Gemini 3.8 Flash и Gemini 3.8 Flash Cyber вышли – это третий выпуск линейки Flash за шесть недель. Обе модели построены на одном ядре, но различаются режимом доступа: обычная версия открыта всем, а Cyber-вариант выдаётся только участникам новой программы Fairwind. Стартовая цена осталась августовской – 0,75 $ за 1 млн входных токенов и 3,75 $ за 1 млн выходных. На тесте DeepSWE v1.1 новинка набрала 73,7% против 74,0% у Claude Opus 5, входные токены которой стоят почти в семь раз дороже.

DeepSWE v1.1: 73,7% против 74,0% у Claude Opus 5
На DeepSWE v1.1 модель должна самостоятельно довести сложную инженерную задачу до рабочего результата. Gemini 3.8 Flash набрала здесь 73,7%: к августовской 3.7 Flash это прибавка в 8,4 процентного пункта, а до Claude Opus 5 не хватило 0,3 пункта. Цифры взяты из анонса Google и приложенной к нему методики; оценки конкурентов частью собраны с открытых таблиц лидеров, частью взяты из публикаций самих поставщиков.
pass@1 – доля задач, решённых с первой попытки, без голосования большинством и без параллельных прогонов. В этом режиме Google приводит все оценки Gemini, если не оговорено иное.
Первое место среди шести сравниваемых моделей 3.8 Flash занимает там, где нужен разбор длинного материала и профессиональная аналитика: 61,4% на Vals Finance Agent v2 с задачами финансового аналитика, 10,0% на Harvey's Legal Agent Benchmark, 89,4% на Terminal-bench 2.1, 86,2% на CharXiv Reasoning и 54,9% на HLE-Verified. Низкое абсолютное значение по юридическому набору объясняется метрикой: засчитывается только полное прохождение процедуры целиком. Понимание длинного видео на LVBench в агентном режиме дало 87,8%.
| Тест | Gemini 3.8 Flash | Gemini 3.7 Flash | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| DeepSWE v1.1 | 73,7% | 65,3% | 74,0% | 72,7% |
| Terminal-bench 2.1 | 89,4% | 85,8% | 89,1% | 88,8% |
| Terminal-bench 4.0 | 19,1% | 11,2% | 51,8% | 37,3% |
| Vals Finance Agent v2 | 61,4% | 59,0% | 58,6% | 53,8% |
| Harvey's Legal Agent Benchmark | 10,0% | 8,8% | 6,7% | 2,5% |
| HLE-Verified | 54,9% | 53,6% | 54,4% | 54,5% |
| LVBench, агентный режим | 87,8% | 85,4% | 75,4% | 82,1% |
| OSWorld-2.0 | 59,0% | 50,6% | 75,4% | 62,6% |
| GDPVal-AA v2, рейтинг Elo | 1545 | 1482 | 1824 | 1710 |
Тесты, где 3.8 Flash уступает более дорогим моделям
В пяти строках таблицы из девяти Gemini 3.8 Flash идёт впереди Claude Opus 5, а отставание начинается там, где нужна общая агентная работа, а не разбор конкретного документа. На Terminal-bench 4.0 у 3.8 Flash 19,1% против 51,8% у Claude Opus 5 и 37,3% у GPT-5.6 Sol. Управление компьютером на OSWorld-2.0 дало 59,0% против 75,4% у Opus 5. По рейтингу GDPVal-AA v2, который измеряет качество умственного труда, разрыв тоже сохраняется: 1545 против 1824 балла Elo. На разборе экспертных PDF-документов в наборе GDP.PDF лучший результат у GPT-5.6 Sol – 40,0% против 35,0%.
Часть замеров сделана в неодинаковых условиях, и это важно при чтении таблицы. Согласно опубликованной методике, видеотест LVBench прогонялся с 1024 кадрами для моделей Gemini и GPT-5.6, но лишь с 300 кадрами для моделей Claude – из-за ограничений их API. На HLE-Verified заметная часть вопросов не дошла до Claude Sonnet 5 и небольшая часть до Opus 5: их отсекли фильтры содержимого. Метрики в таблице тоже разного типа – GDPVal-AA v2 даёт рейтинг Elo, остальные строки означают долю решённых задач.
Стартовая цена действует до 31 декабря 2026 года
Тариф на 3.8 Flash повторяет августовский: 0,75 $ за 1 млн входных токенов и 3,75 $ за 1 млн выходных. Это вводная цена, срок её действия истекает , а с вступают в силу 1,50 $ и 7,50 $ соответственно. Тот же переход ждёт и 3.7 Flash.
Экономия на тарифе не означает экономию на счёте. В Google прямо предупреждают, что прирост качества получен за счёт дополнительной работы: на сложных задачах модель выполняет лишние шаги рассуждений и вызывает инструменты по нескольку раз, поэтому выходных токенов уходит больше, особенно на высоких уровнях усилий. Уровень усилий можно понизить или остаться на 3.7 Flash – её продолжают поддерживать для нагрузок, где важнее всего стоимость.
Модель открыта в Gemini API, Google AI Studio, Android Studio, Google Antigravity и Stitch, корпоративным клиентам – в Gemini Enterprise. Подписчики Google AI Pro и Ultra получают её в приложении Gemini, в Режиме ИИ Google Поиска и в Google Таблицах.
Gemini 3.8 Flash Cyber: поиск уязвимостей и автоматические патчи
Cyber-вариант заменяет 3.5 Flash Cyber, вышедшую вместе с 3.6 Flash. Специализация прежняя – обнаружение уязвимостей и подготовка исправлений, но акцент смещён в сторону защиты: возможности эксплуатации в Google сознательно не развивали, приоритет отдан устранению дефектов.
На отраслевом наборе CyberGym, где ищут уязвимости в коде на C и C++, модель, по заявлению Google, обходит и предшественницу, и заметно более крупные передовые модели; числовых значений в тексте анонса нет, они приведены только на диаграмме. На внутреннем наборе, охватывающем два десятка языков программирования, доля успешных находок превысила 70%. На внешнем наборе CWE-Bench, который ведёт компания Collinear и который оценивает именно качество исправлений, результат составил 47,2% против 47,8% у ведущей передовой модели – при существенно меньшей стоимости прогона.
CWE-Bench – независимый набор задач на исправление уязвимостей: модель получает уязвимый код и должна выдать патч, который проходит проверку. Публичная таблица лидеров доступна на сайте CWE-Bench.
В подразделении Chrome Security насчитали в 2,6 раза больше корректных патчей к уязвимостям браузера Chrome, чем у крупнейших коммерческих моделей. В компании Wiz получили полноту обнаружения выше на 7,5–9,7% на собственном наборе для тестирования на проникновение при стоимости прогона в 2,3–5,2 раза ниже. Специалисты Google Cloud по исследованию уязвимостей нашли с помощью модели критическую ошибку меньше чем за два часа, тогда как обычно на такую работу уходят месяцы. Все три оценки Google приводит по итогам собственных внедрений, независимой проверки они не проходили. К этому в компании добавляют, что обе версии 3.8 стали устойчивее к prompt injection по замерам Gray Swan, но числа снова остались на диаграмме.
Программа Fairwind и условия доступа к Cyber-модели
Cyber-версия поставляется с менее строгими ограничениями в области кибербезопасности, поэтому в общий доступ её не выкладывают. Получить модель можно только через Fairwind Program, запущенную в тот же день. По заявлению Google, в программе уже более 650 организаций-партнёров.
Fairwind Program – программа ограниченного доступа Google к средствам киберзащиты для государственных структур и проверенных партнёров. Заявку подают на сайте Google DeepMind, отбор проходят три категории участников.
Первое направление отбора – государственные органы и национальные центры кибербезопасности, второе – операторы критической инфраструктуры в здравоохранении, связи, энергетике и финансах, третье – владельцы базовых технологических платформ. Участники подписываются под операционными требованиями: работать с моделью разрешено только сотрудникам внутренних служб кибербезопасности, реагирования на инциденты и тестирования на проникновение, а вход защищается многофакторной аутентификацией.
Вместе с моделью партнёры получают CodeMender: он доводит найденную уязвимость до проверенного патча внутри защищённого облачного контура заказчика. Вместо недель ручной работы в Google обещают готовые к развёртыванию исправления за минуты. Клиентам Google Cloud, не попавшим в программу, CodeMender остаётся доступен с общедоступными моделями на Gemini Enterprise Agent Platform, а условия участия опубликованы в отдельном сообщении Google.
CodeMender – инструмент Google Cloud, который в связке с языковой моделью находит, проверяет и исправляет уязвимости в исходном коде, выдавая готовый к развёртыванию патч.
Заключение
За шесть недель линейка Flash сменила три версии, и 3.8 Flash закрепляет схему выпуска: новая модель приходит по льготному тарифу, который через несколько месяцев поднимается вдвое. Выигрыш в цене частично уходит на возросший расход выходных токенов, поэтому при переходе с 3.7 Flash разумнее сравнивать стоимость решения одной задачи, а не тариф за миллион токенов. Тем, кто отвечает за безопасность кода, доступ к Cyber-версии придётся запрашивать через Fairwind Program; остальным остаётся CodeMender с общедоступными моделями.