Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite получили агентную обработку видео

61 комментарии
Агентный режим разбора видео открыт 1 сентября 2026 года через Gemini API в Google AI Studio и на Gemini Enterprise Agent Platform. Нужные отрезки, частота кадров и канал – кадры, звук или расшифровка – подбираются под запрос. Отдельной платы нет

Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite 2026 года получили второй режим обработки видео – агентный. Отрезки для просмотра, частота кадров и канал данных – кадры, звук или расшифровка – подбираются на ходу под текст запроса, а не задаются заранее. В Google приводят экономию до 88% токенов и до 66% стоимости анализа при росте точности до 7%. Режим работает через Gemini API в Google AI Studio и на Gemini Enterprise Agent Platform, отдельной платы за него нет.

comss img 2026 09 02 100151

Чем агентный режим отличается от статического

По умолчанию видео обрабатывается статически: из записи вырезается один кадр в секунду, звук обрабатывается потоком 1 Кбит/с в одном канале, временные метки проставляются каждую секунду. Весь массив попадает в контекст за один проход, поэтому расход токенов растёт линейно с длиной ролика. При низком разрешении медиа кадр обходится в 66 токенов, при высоком – в 258; на каждую секунду звука уходит ещё 32 токена. В сумме секунда видео стоит примерно 100 токенов при низком разрешении и примерно 300 при высоком.

media_resolution – параметр Gemini API, задающий верхний предел токенов на одно изображение или на один кадр видео. Настраивается независимо от режима обработки: повышение разрешения помогает разобрать мелкий текст и детали, но увеличивает расход токенов и задержку.

Агентная обработка устроена иначе. Вместо сплошной выборки вызывается внутренний инструмент, через который подгружаются только фрагменты, нужные для ответа: сначала расшифровка, затем при необходимости кадры или звуковая дорожка выбранного отрезка. Частота кадров и разрешение подбираются по ходу разбора, поэтому один и тот же ролик на разных запросах обходится в разное число токенов. Расход при этом делится надвое: навигация по временной шкале учитывается в поле total_thought_tokens, а загруженные кадры, звук и расшифровка – в total_tool_use_tokens.

Тот же подход в Google ранее применили к изображениям: в агентном зрении обработка картинок сочетается с исполнением кода. Для видео исполнение кода заменили собственными видеоинструментами Gemini – поиском по записи, сканированием и разбором отдельных отрезков.

Экономия токенов на LVBench, 1H-VideoQA и MINERVA

Замеры проведены на Gemini 3.7 Flash при высоком уровне рассуждений и низком разрешении медиа; статический режим брался с частотой один кадр в секунду. Числа взяты из анонса Google и относятся к собственному тестированию компании.

Набор тестовТокены, статикаТокены, агентЭкономияТочность, статикаТочность, агент
MINERVA80,9 тыс.33,6 тыс.58,4%73,7%79,0%
1H-VideoQA397,6 тыс.47,7 тыс.88,0%87,5%88,5%
LVBench300,3 тыс.36,0 тыс.88,0%85,1%88,6%

LVBench – открытый набор тестов на понимание длинных видео, опубликованный в 2024 году; ролики в нём длятся в среднем около часа. 1H-VideoQA проверяет ответы по часовым записям, MINERVA – многошаговые рассуждения по роликам от двух минут до полутора часов.

Прирост точности в анонсе назван относительным, и это меняет масштаб цифры. На MINERVA результат поднимается с 73,7% до 79,0%, то есть на 5,3 процентного пункта; в относительных величинах это и есть заявленные 7,2%. На LVBench разрыв составляет 3,5 пункта, на 1H-VideoQA – один пункт. Экономия токенов, наоборот, дана напрямую: с 397,6 тыс. до 47,7 тыс. на запрос в тесте 1H-VideoQA.

Снижение стоимости до 66% приведено отдельной строкой, без разбивки по тестам. На опубликованных графиках есть только токены и точность, поэтому сопоставить экономию токенов с экономией денег по каждому набору не получится. На втором графике сопоставлены стоимость запроса и точность на 1H-VideoQA у Gemini 3.7 Flash и у моделей конкурентов, но перечень сравниваемых моделей в тексте анонса не приведён.

Где статический режим остаётся предпочтительным

Агентная обработка не заменяет статическую целиком, и в документации прямо перечислены случаи, когда старый режим лучше. На роликах короче пяти минут навигация увеличивает время до первого токена: перед началом генерации выполняются внутренние рассуждения и обращения к инструменту. Если запрос чувствителен к задержке, выигрыш по токенам не окупается.

Time to First Token (TTFT) – время от отправки запроса до появления первого символа ответа. На коротких видео агентная навигация удлиняет этот промежуток, хотя общий расход токенов снижается.

Второе ограничение жёстче. Тонкая настройка обработки работает только в статическом режиме: обрезка по началу и концу через start_offset и end_offset, а также собственная частота кадров через параметр fps. В агентном режиме эти поля не поддерживаются, поэтому покадровый разбор всего ролика по-прежнему делается статикой. Ограничения на источники видео общие для обоих режимов: на бесплатном уровне доступа за сутки разрешено загрузить не более восьми часов роликов с YouTube, в один запрос помещается до десяти видео, и ссылки принимаются только на общедоступные записи.

Есть и потолок по длительности. Модели с окном контекста в 1 млн токенов разбирают видео до трёх часов при низком разрешении медиа и до часа при высоком.

Как включить агентный режим в Gemini API

Отдельного тарифа у функции нет, оплата идёт по обычным ставкам Gemini API за токены. Переключение сводится к одному полю в блоке видео:

"processing": "agentic"

Режим задаётся для каждого видео отдельно, поэтому в одном запросе часовую лекцию можно разбирать агентно, а короткий фрагмент – статически. Проверить, что агентный путь действительно сработал, можно по массиву interaction.steps: в нём появляются шаги processing_call и processing_result, привязанные друг к другу через id и call_id. Они идут вперемежку с шагами thought и предшествуют итоговому model_output; отвечать на них не нужно, но их удобно показывать в интерфейсе как ход разбора.

Одна тонкость касается многошаговых диалогов. При работе с сохранением состояния через previous_interaction_id контекст видео держит сервер. Без сохранения состояния, через step_list, шаги processing_call и processing_result нужно возвращать в следующий запрос: ошибки API не будет, но контекст видео потеряется и качество ответов на уточняющие вопросы упадёт. Возвращённые шаги при этом считаются во входных токенах. Подробности собраны в документации Gemini API.

Приложение Gemini и функция «Спросить YouTube»

Пока агентная обработка ограничена Gemini API в Google AI Studio и площадкой Gemini Enterprise Agent Platform. В приложении Gemini её обещают включить всем пользователям на моделях Flash и Flash-Lite, срок в анонсе не назван – сказано только «скоро».

В ближайшие месяцы на агентную обработку переведут функцию «Спросить YouTube» на странице просмотра ролика, кнопка которой подписана «Задавайте вопросы». В Google рассчитывают, что ответы станут качественнее, поскольку будут опираться на изображение, а не только на расшифровку звука.

Заключение

На длинных записях расход токенов больше не растёт линейно с длительностью: часовая лекция укладывается в десятки тысяч токенов вместо сотен тысяч. Выигрыш заметен на многочасовых материалах и почти исчезает на коротких роликах, где агентная навигация добавляет задержку перед первым словом ответа. Авторам приложений, которые уже разбирают видео через Gemini API, имеет смысл прогнать свои сценарии в обоих режимах и сравнить не только расход токенов, но и время отклика. Обрезку по времени и собственную частоту кадров придётся оставить статике – в агентном режиме эти поля не работают.

Автор:
Комментарии и отзывы

Нашли ошибку?

Новое на сайте