Gemini 3.7 Flash вышла , через три недели после 3.6 Flash, со стартовой ценой 0,75 $ за 1 млн входных токенов и 3,75 $ за 1 млн выходных – вдвое ниже прежнего тарифа серии. На собственных тестах Google прирост к предшественнице составил 9,2 процентного пункта на FrontierCode 1.1 Main, 16,7 на DeepSWE v1.1 и 12 на GDP.pdf. Разработчикам и корпоративным клиентам её открыли сразу в Gemini API, Android Studio, Google Antigravity и Gemini Enterprise. В приложении Gemini единственный путь к 3.7 Flash – агент Gemini Spark, а он требует подписки Google AI Pro или Ultra и не работает в Европейской экономической зоне, Великобритании, Швейцарии и Нигерии.
Прирост на тестах разработки: FrontierCode 1.1 и DeepSWE v1.1

Заметнее всего разрыв с предыдущей версией виден на двух наборах задач по написанию кода. FrontierCode 1.1 Main, где оценивают качество промышленного кода, 3.7 Flash проходит на 43,6% против 34,4% у 3.6 Flash. На DeepSWE v1.1, где задачи растянуты на много шагов и требуют разбора репозитория, счёт вырос с 48,6% до 65,3%.
В терминале картина похожая: Terminal-bench 2.1 – 85,8% против 78,0%, Terminal-bench 3.0 – 14,9% против 5,4%. Последняя цифра показывает, насколько ранняя стадия у самого теста: обе модели решают меньше пятой части заданий.
В веб-разработке модель набрала 1588 очков Elo на Code Arena против 1538 у предшественницы. По формулировке анонса Google, на 3.7 Flash работоспособная вёрстка и приложения с полным набором функций получаются за меньшее число запросов, а при генерации интерфейса за образец берётся скриншот, изображение или целая дизайн-система.
Elo – рейтинг, который считают по итогам парных сравнений: варианты сопоставляют друг с другом, и очки перераспределяются в зависимости от того, кто выиграл и насколько сильным был соперник.
Отдельные утверждения анонса числами не подкреплены: заявлено, что модель лучше справляется с отладкой и разбором проблем, а также точнее пишет код с первой попытки. Конкретных значений по этим пунктам Google не привела.
Документы, право и биология: GDP.pdf, Harvey LAB-AA и AutomationBench
Вторая группа изменений касается насыщенных знаниями областей – финансов, права и биологических наук. На GDP.pdf, где проверяют разбор сложных документов, результат вырос с 22,0% до 34,0%. На закрытом наборе AutomationBench, собранном из реальных корпоративных процессов, – с 17,0% до 30,4%.
Юридические сценарии Harvey LAB-AA модель проходит на 90,7% против 85,1%, исследовательские задачи по биологии LABBench2 – на 82,1% против 76,1%. Рейтинг GDPval-AA v2, оценивающий интеллектуальную работу целиком, поднялся с 1422 до 1525 очков Elo.
Прибавка есть и в работе с длинным контекстом: GDM-MRCR v2 в конфигурации с восемью искомыми фрагментами на 128 тыс. токенов – 97,0% против 91,8%. Понимание длинных видео (LVBench) выросло незначительно, с 84,2% до 85,4%.
Тесты 3.7 Flash рядом с 3.6 Flash и конкурентами
Все значения в таблице ниже опубликованы Google, включая результаты чужих моделей – Claude Sonnet 5 (Anthropic), GPT-5.6 Terra (OpenAI) и Muse Spark 1.2 (Meta). Прочерк означает, что модель на этом наборе не тестировали.
| Тест | 3.7 Flash | 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra | Muse Spark 1.2 |
|---|---|---|---|---|---|
| Artificial Analysis Intelligence Index | 56 | 52 | 55 | 57 | 57 |
| FrontierCode 1.1 Main | 43,6% | 34,4% | 42,7% | 41,3% | - |
| DeepSWE v1.1 | 65,3% | 48,6% | 53,8% | 69,6% | 54,9% |
| Code Arena (Elo) | 1588 | 1538 | 1541 | 1523 | 1535 |
| Terminal-bench 2.1 | 85,8% | 78,0% | 80,4% | 87,4% | 82,9% |
| Terminal-bench 3.0 | 14,9% | 5,4% | 14,6% | 20,8% | - |
| AutomationBench | 30,4% | 17,0% | 10,7% | 23,6% | - |
| GDPval-AA v2 (Elo) | 1525 | 1422 | 1598 | 1578 | 1628 |
| Harvey LAB-AA | 90,7% | 85,1% | 90,1% | 85,2% | - |
| GDP.pdf | 34,0% | 22,0% | 28,0% | 24,7% | 16,0% |
| CharXiv Reasoning (без инструментов) | 84,5% | 85,2% | 77,0% | 85,9% | - |
| CharXiv Reasoning (с инструментами) | 88,7% | 89,4% | 88,3% | - | - |
| LVBench | 85,4% | 84,2% | 68,5% | 78,9% | - |
| GDM-MRCR v2 (8 фрагментов, 128k) | 97,0% | 91,8% | 81,5% | 93,5% | - |
| OSWorld-2.0 | 47,9% | 33,8% | - | 50,2% | - |
| Agent's Last Exam | 26,3% | 24,2% | 33,3% | 28,0% | - |
| HLE-Verified | 53,6% | 51,2% | 31,0% | 51,1% | - |
| BioMysteryBench (посильные для человека) | 87,1% | 80,6% | 87,5% | 83,8% | - |
| BioMysteryBench (трудные для человека) | 43,5% | 41,2% | 34,1% | 49,4% | - |
| LABBench2 | 82,1% | 76,1% | 80,1% | 81,2% | - |
Где 3.7 Flash уступает конкурентам и собственному предшественнику
Сводная оценка Artificial Analysis Intelligence Index у новой модели – 56 очков против 57 у GPT-5.6 Terra и Muse Spark 1.2. На части наборов отставание доходит до нескольких процентных пунктов.
- DeepSWE v1.1: 65,3% против 69,6% у GPT-5.6 Terra.
- Terminal-bench 2.1: 85,8% против 87,4%, Terminal-bench 3.0 – 14,9% против 20,8% у той же модели.
- OSWorld-2.0: 47,9% против 50,2% у GPT-5.6 Terra.
- Agent's Last Exam: 26,3% против 33,3% у Claude Sonnet 5.
- BioMysteryBench на трудных для человека задачах: 43,5% против 49,4% у GPT-5.6 Terra.
- GDPval-AA v2: 1525 очков – ниже всех трёх конкурентов из таблицы (1598, 1578 и 1628 соответственно).
Один набор новая модель проходит хуже, чем 3.6 Flash. На CharXiv Reasoning, где нужно вытаскивать сведения из сложных графиков, счёт без инструментов упал с 85,2% до 84,5%, с инструментами – с 89,4% до 88,7%. В анонсе этот тест не упомянут, цифры есть только в развёрнутой таблице.
Значения конкурентов получены в тестовых прогонах Google, а не независимой лабораторией, и сравнивать их с числами из чужих анонсов напрямую нельзя: результат агентных наборов заметно меняется в зависимости от того, внутри какого инструмента запущена модель.
Стартовая цена 0,75 $ действует до 31 декабря 2026 года
Тариф на 3.7 Flash – 0,75 $ за 1 млн входных токенов и 3,75 $ за 1 млн выходных. Это стартовая цена: она держится до , а с вырастает вдвое, до 1,50 $ и 7,50 $.
Тот же сниженный тариф Google распространила и на 3.6 Flash. В июльском анонсе та модель стоила 1,50 $ и 7,50 $ за миллион токенов, так что обе версии серии сейчас идут по одной цене.
Для сравнения, в той же таблице Google приводит расценки конкурентов: Claude Sonnet 5 – 2,00 $ и 10,00 $, GPT-5.6 Terra – 2,00 $ и 12,00 $, Muse Spark 1.2 – 1,25 $ и 4,25 $ за миллион входных и выходных токенов.
Почему в приложении Gemini модель закрыта подпиской Pro и Ultra
В списке каналов доступа, который Google опубликовала вместе с анонсом, частным пользователям отведён один пункт: 3.7 Flash доступна через Gemini Spark подписчикам Google AI Pro и Ultra более чем в 160 странах. Отдельного переключателя на новую модель в приложении Gemini нет, поэтому у бесплатного тарифа доступа к ней не появилось.
Gemini Spark – персональный агент внутри приложения Gemini, который выполняет многошаговые задачи в фоне и по расписанию, подключаясь к Gmail, Google Календарю, Google Диску, Документам, Таблицам, Презентациям, Keep и Задачам.
Причин Google не назвала. Но требования к самому Spark в справке Google перечислены прямо, и они объясняют, почему круг получателей узкий:
- возраст от 18 лет;
- вход в приложение Gemini под личным аккаунтом Google – рабочие и учебные аккаунты пока не подходят;
- активная подписка Google AI Pro или Ultra;
- включённое сохранение истории действий в приложениях Gemini;
- Spark не работает в Европейской экономической зоне, Великобритании, Швейцарии и Нигерии.
Google называет Spark экспериментальной функцией на ранней стадии разработки и отдельно предупреждает о рисках агентных сценариев – в том числе о внедрении вредоносных инструкций в письма, документы и веб-страницы, которые агент читает во время работы. К этому добавлены количественные ограничения: одновременно у пользователя может выполняться не более 15 задач, а расход считается по общим лимитам приложения, которые растут вместе с уровнем подписки.
Иначе говоря, ограничение относится не к самой модели, а к каналу её доставки. Через Gemini API 3.7 Flash открыта всем разработчикам, а в приложении Gemini она пока существует только внутри платного агента.
Gemini API, Android Studio и Antigravity: доступ для разработчиков
Идентификатор модели в API – gemini-3.7-flash. Она принимает до 1 млн токенов контекста и выдаёт до 64 тыс. токенов ответа, а объём вычислений на обдумывание задаётся тремя уровнями: low, medium и high. Значение minimal, доступное в некоторых прежних моделях, здесь вызывает ошибку проверки запроса.
Уровень размышлений – параметр Gemini API, задающий, сколько вычислений модель тратит на обдумывание перед выдачей ответа. Чем ниже уровень, тем быстрее приходит ответ.
Помимо Gemini API через Google AI Studio, модель включили в Android Studio и в агентную среду Google Antigravity. Корпоративным клиентам она доступна на платформе Gemini Enterprise Agent Platform и в приложении Gemini Enterprise.
По части безопасности 3.7 Flash вышла с обновлёнными ограничениями по требованиям Frontier Safety в двух направлениях: химическое, биологическое, радиологическое и ядерное оружие (CBRN) и наступательные операции в киберпространстве. Подробности вынесены в карточку модели.
Заключение
За три недели серия Flash получила прибавку в 9–17 процентных пунктов на наборах по разработке и работе с документами при цене вдвое ниже прежней. Разработчикам это даёт заметно более дешёвый вариант для агентных сценариев, где расход токенов измеряется миллионами.
Владельцам обычных аккаунтов Gemini прямой пользы пока нет: новая модель существует для них только внутри Spark, а Spark требует подписки и недоступен в целом ряде стран. Тем, кто пользуется 3.6 Flash по API, стоит учесть, что сниженная цена у обеих версий закончится 31 декабря 2026 года и тариф вернётся к 1,50 $ и 7,50 $ за миллион токенов.