Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite 2026 года получили второй режим обработки видео – агентный. Отрезки для просмотра, частота кадров и канал данных – кадры, звук или расшифровка – подбираются на ходу под текст запроса, а не задаются заранее. В Google приводят экономию до 88% токенов и до 66% стоимости анализа при росте точности до 7%. Режим работает через Gemini API в Google AI Studio и на Gemini Enterprise Agent Platform, отдельной платы за него нет.

Чем агентный режим отличается от статического
По умолчанию видео обрабатывается статически: из записи вырезается один кадр в секунду, звук обрабатывается потоком 1 Кбит/с в одном канале, временные метки проставляются каждую секунду. Весь массив попадает в контекст за один проход, поэтому расход токенов растёт линейно с длиной ролика. При низком разрешении медиа кадр обходится в 66 токенов, при высоком – в 258; на каждую секунду звука уходит ещё 32 токена. В сумме секунда видео стоит примерно 100 токенов при низком разрешении и примерно 300 при высоком.
media_resolution – параметр Gemini API, задающий верхний предел токенов на одно изображение или на один кадр видео. Настраивается независимо от режима обработки: повышение разрешения помогает разобрать мелкий текст и детали, но увеличивает расход токенов и задержку.
Агентная обработка устроена иначе. Вместо сплошной выборки вызывается внутренний инструмент, через который подгружаются только фрагменты, нужные для ответа: сначала расшифровка, затем при необходимости кадры или звуковая дорожка выбранного отрезка. Частота кадров и разрешение подбираются по ходу разбора, поэтому один и тот же ролик на разных запросах обходится в разное число токенов. Расход при этом делится надвое: навигация по временной шкале учитывается в поле total_thought_tokens, а загруженные кадры, звук и расшифровка – в total_tool_use_tokens.
Тот же подход в Google ранее применили к изображениям: в агентном зрении обработка картинок сочетается с исполнением кода. Для видео исполнение кода заменили собственными видеоинструментами Gemini – поиском по записи, сканированием и разбором отдельных отрезков.
Экономия токенов на LVBench, 1H-VideoQA и MINERVA
Замеры проведены на Gemini 3.7 Flash при высоком уровне рассуждений и низком разрешении медиа; статический режим брался с частотой один кадр в секунду. Числа взяты из анонса Google и относятся к собственному тестированию компании.
| Набор тестов | Токены, статика | Токены, агент | Экономия | Точность, статика | Точность, агент |
|---|---|---|---|---|---|
| MINERVA | 80,9 тыс. | 33,6 тыс. | 58,4% | 73,7% | 79,0% |
| 1H-VideoQA | 397,6 тыс. | 47,7 тыс. | 88,0% | 87,5% | 88,5% |
| LVBench | 300,3 тыс. | 36,0 тыс. | 88,0% | 85,1% | 88,6% |
LVBench – открытый набор тестов на понимание длинных видео, опубликованный в 2024 году; ролики в нём длятся в среднем около часа. 1H-VideoQA проверяет ответы по часовым записям, MINERVA – многошаговые рассуждения по роликам от двух минут до полутора часов.
Прирост точности в анонсе назван относительным, и это меняет масштаб цифры. На MINERVA результат поднимается с 73,7% до 79,0%, то есть на 5,3 процентного пункта; в относительных величинах это и есть заявленные 7,2%. На LVBench разрыв составляет 3,5 пункта, на 1H-VideoQA – один пункт. Экономия токенов, наоборот, дана напрямую: с 397,6 тыс. до 47,7 тыс. на запрос в тесте 1H-VideoQA.
Снижение стоимости до 66% приведено отдельной строкой, без разбивки по тестам. На опубликованных графиках есть только токены и точность, поэтому сопоставить экономию токенов с экономией денег по каждому набору не получится. На втором графике сопоставлены стоимость запроса и точность на 1H-VideoQA у Gemini 3.7 Flash и у моделей конкурентов, но перечень сравниваемых моделей в тексте анонса не приведён.
Где статический режим остаётся предпочтительным
Агентная обработка не заменяет статическую целиком, и в документации прямо перечислены случаи, когда старый режим лучше. На роликах короче пяти минут навигация увеличивает время до первого токена: перед началом генерации выполняются внутренние рассуждения и обращения к инструменту. Если запрос чувствителен к задержке, выигрыш по токенам не окупается.
Time to First Token (TTFT) – время от отправки запроса до появления первого символа ответа. На коротких видео агентная навигация удлиняет этот промежуток, хотя общий расход токенов снижается.
Второе ограничение жёстче. Тонкая настройка обработки работает только в статическом режиме: обрезка по началу и концу через start_offset и end_offset, а также собственная частота кадров через параметр fps. В агентном режиме эти поля не поддерживаются, поэтому покадровый разбор всего ролика по-прежнему делается статикой. Ограничения на источники видео общие для обоих режимов: на бесплатном уровне доступа за сутки разрешено загрузить не более восьми часов роликов с YouTube, в один запрос помещается до десяти видео, и ссылки принимаются только на общедоступные записи.
Есть и потолок по длительности. Модели с окном контекста в 1 млн токенов разбирают видео до трёх часов при низком разрешении медиа и до часа при высоком.
Как включить агентный режим в Gemini API
Отдельного тарифа у функции нет, оплата идёт по обычным ставкам Gemini API за токены. Переключение сводится к одному полю в блоке видео:
"processing": "agentic"
Режим задаётся для каждого видео отдельно, поэтому в одном запросе часовую лекцию можно разбирать агентно, а короткий фрагмент – статически. Проверить, что агентный путь действительно сработал, можно по массиву interaction.steps: в нём появляются шаги processing_call и processing_result, привязанные друг к другу через id и call_id. Они идут вперемежку с шагами thought и предшествуют итоговому model_output; отвечать на них не нужно, но их удобно показывать в интерфейсе как ход разбора.
Одна тонкость касается многошаговых диалогов. При работе с сохранением состояния через previous_interaction_id контекст видео держит сервер. Без сохранения состояния, через step_list, шаги processing_call и processing_result нужно возвращать в следующий запрос: ошибки API не будет, но контекст видео потеряется и качество ответов на уточняющие вопросы упадёт. Возвращённые шаги при этом считаются во входных токенах. Подробности собраны в документации Gemini API.
Приложение Gemini и функция «Спросить YouTube»
Пока агентная обработка ограничена Gemini API в Google AI Studio и площадкой Gemini Enterprise Agent Platform. В приложении Gemini её обещают включить всем пользователям на моделях Flash и Flash-Lite, срок в анонсе не назван – сказано только «скоро».
В ближайшие месяцы на агентную обработку переведут функцию «Спросить YouTube» на странице просмотра ролика, кнопка которой подписана «Задавайте вопросы». В Google рассчитывают, что ответы станут качественнее, поскольку будут опираться на изображение, а не только на расшифровку звука.
Заключение
На длинных записях расход токенов больше не растёт линейно с длительностью: часовая лекция укладывается в десятки тысяч токенов вместо сотен тысяч. Выигрыш заметен на многочасовых материалах и почти исчезает на коротких роликах, где агентная навигация добавляет задержку перед первым словом ответа. Авторам приложений, которые уже разбирают видео через Gemini API, имеет смысл прогнать свои сценарии в обоих режимах и сравнить не только расход токенов, но и время отклика. Обрезку по времени и собственную частоту кадров придётся оставить статике – в агентном режиме эти поля не работают.