Google представила Agentic Video Understanding — новый режим, который делает Gemini точнее и экономнее при анализе видео. Он уже доступен для семей Gemini 3.7 Flash, Gemini 3.6 Flash и Gemini 3.5 Flash-Lite.
Google изменила подход к обработке роликов: теперь Gemini сам определяет, какие фрагменты нужно смотреть, с какой скоростью их разбирать и на что обращать внимание. Модель может опираться на визуальный ряд, звук или субтитры — в зависимости от задачи.
Меньше токенов и ниже расходы
В Google утверждают, что новый подход способен снизить расход токенов до 88% и сократить затраты на обработку до 66%. При этом точность видеоанализа, по заявлению компании, должна вырасти.
Система рассчитана как на короткие ролики, так и на записи длительностью в несколько часов. Примером Google называет 10-минутные обучающие видео, а также записи занятий, лекции и встречи.
Какие задачи теперь доступны Gemini
Agentic Video Understanding позволяет считать объекты и повторяющиеся действия в кадре, а также находить необычные события в длинных записях. Кроме того, Gemini может определять нужные моменты с точной привязкой ко времени, что упрощает поиск в больших видеоархивах.
Google также отмечает, что разработчикам не придётся писать столько собственной логики для выбора нужных фрагментов видео, как раньше. Это должно упростить создание приложений для работы с длинными роликами.
Где уже доступна технология
Использовать Agentic Video Understanding можно через Gemini API в Google AI Studio или через Gemini Enterprise Agent Platform. В настройках API нужно выбрать для видео режим обработки Agentic.
Google отдельно подчёркивает, что за саму функцию дополнительная плата не взимается — действует обычная токенизация Gemini.
Что появится дальше
Позже технология должна добраться до приложения Gemini, а также до Ask YouTube. В Google говорят, что это упростит анализ длинных роликов и поможет точнее отвечать на вопросы о конкретных сценах, объяснениях и моментах.
Источник: Google




