Gemini 4 Argon: сравнение с GPT-6 Astra и Claude Opus 5.5

65 комментарии
Google опубликовала результаты новой модели в тестах программирования, финансов, науки и управления компьютером. Argon получила 68,9% в Vals Index и разделила лидерство с Astra в CWE-bench, но уступила в FrontierSWE и OSWorld. Сравнение учитывает условия замеров; доступ пока ограничен проверенными участниками

Google представила Gemini 4 Argon – новую старшую ИИ-модель для программирования, профессиональной аналитики, киберзащиты и продолжительных многошаговых задач. Компания заявляет предел вывода до 1 млн токенов и публикует сравнение с GPT-6 Astra и моделями Claude. Argon уже используют внутри Google, а отдельные проверенные специалисты по киберзащите получают доступ через Fairwind Program. Запуск для платных клиентов API и подписчиков Google AI Ultra обещан позднее, без точной даты.

comss img 2026 10 01 052726
Gemini 4 Argon

Что изменилось в Gemini 4 Argon

Google рассчитывает применять Argon в задачах, для которых недостаточно одного короткого ответа: изучении больших проектов, разработке и проверке кода, финансовых исследованиях, подготовке юридических документов и работе с визуальными материалами. Модель должна сохранять ход выполнения задачи на протяжении большого числа шагов, использовать инструменты и проверять промежуточные результаты.

Одно из главных заявленных изменений – увеличение предела выходных токенов с прежних 64 тысяч до 1 млн. По объяснению Google, такой запас позволяет модели дольше рассуждать и выполнять сложную работу в рамках одного продолжительного запуска. Это заявленный предел вывода; его нельзя автоматически считать размером входного контекстного окна или гарантированным объёмом ответа в приложении Gemini.

В карточке Argon у Vals AI указано контекстное окно на 1 млн токенов, однако предел вывода в параметрах проведённых этой организацией запусков составляет 262 144 токена. Vals также указывает уровень рассуждения high и температуру 1,0. Эти параметры описывают опубликованные оценки Vals и отличаются от максимального вывода, заявленного Google в анонсе.

Как отмечает 9to5Google, Argon появляется после отмены выпуска Gemini 3.5 Pro и развития линейки Gemini 3.8 Flash. Новая модель получила собственное название внутри поколения Gemini 4. При этом публичный запуск Argon ещё не состоялся: параметры обычного доступа через приложения и API предстоит уточнить.

Программирование: где Argon опережает конкурентов, а где уступает

На DeepSWE v1.1 Argon получила 77,9% против 74,2% у Claude Opus 5.5 и 74,1% у GPT-6 Astra. Разница составляет 3,7 и 3,8 процентного пункта соответственно. Однако результат зависит от типа инженерной задачи: в FrontierSWE v2 и Terminal-Bench 4.0 новая модель Google уступает всем трём участникам опубликованного сравнения.

Ниже приведены результаты из официальной таблицы Google DeepMind. Во всех этих строках большее значение означает лучший результат, но показатели разных бенчмарков нельзя складывать или считать единой оценкой качества модели.

Тест и что он проверяет Gemini 4 Argon GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5
DeepSWE v1.1 – продолжительные инженерные задачи в реальных открытых репозиториях: агент должен внести изменения и получить проверяемый рабочий результат. 77,9% 74,1% 67,4% 74,2%
FrontierSWE v2 – 34 сложные задачи разработки и исследований с бюджетом до 20 часов, включая оптимизацию, научные вычисления и машинное обучение. 55,0% 65,5% 56,3% 62,3%
Vibe Code Bench – создание веб-приложений с нуля по описанию на естественном языке. 91,9% 89,6% 90,3% 90,3%
Terminal-Bench 4.0 – выполнение сложных практических задач через терминал с проверкой конечного результата. 57,4% 58,2% 57,9% 66,4%
PostTrainBench – способность агента самостоятельно дообучать базовые языковые модели при ограниченном времени и вычислительных ресурсах. 45,3% 44,3% 40,2% 49,3%

В FrontierSWE v2 преимущество Astra над Argon достигает 10,5 процентного пункта. В Terminal-Bench 4.0 лучший результат среди этих четырёх моделей у Opus 5.5 – 66,4%, а в PostTrainBench – 49,3%.

Первое место Argon в строке Vibe Code Bench относится только к выбранным Google участникам. В более широком рейтинге Vals AI впереди находится Claude Sonnet 5.5 с 92,39%, тогда как точный результат Argon составляет 91,91%.

Финансовая аналитика, юридические документы и автоматизация работы

В профессиональных задачах Argon получила лучшие результаты среди четырёх моделей в таблице Google. Здесь проверяется работа с источниками, документами, расчётами и приложениями, а не только правильность ответа на отдельный вопрос.

Тест и что он проверяет Gemini 4 Argon GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5
Vals Index – сводный показатель задач в финансах, программировании, праве и налогообложении. Направления взвешены по их вкладу в ВВП США. 68,9% 63,1% 65,8% 67,0%
AutomationBench – выполнение рабочих процессов через 47 моделируемых приложений в продажах, маркетинге, операционной работе, поддержке, финансах и управлении персоналом. 51,3% 41,4% 31,4% 42,5%
Vals Finance Agent v2 – многошаговая работа финансового аналитика: поиск сведений в отчётности компаний, расчёты и применение финансовых правил. 65,4% 53,5% 58,9% 58,6%
Harvey's Legal Agent Benchmark – юридические исследования и подготовка документов. Назначение теста описано в анонсе Google, результаты Argon – в карточке Vals AI. 19,6% 5,4% 6,7% 3,8%

В Vals Index Argon действительно занимает первое место и в общем рейтинге. Однако преимущество в выбранной таблице не распространяется на все юридические оценки: в карточке Vals AI результат 19,58% в Harvey's Legal Agent Benchmark соответствует пятому месту среди 73 моделей.

В AutomationBench от Zapier проверяется состояние приложений после действий агента. Чтобы задача считалась выполненной, должны пройти все обязательные проверки. Поэтому 51,3% означает полное выполнение примерно половины задач этого набора, даже при первом месте в рейтинге.

У результата Claude Fable 5.1 в AutomationBench есть отдельное условие: при отказах её фильтра безопасности часть работы выполняла Opus 5. По пояснению Zapier, это затронуло около 40% задач. Результат Opus 5.5 также учитывает стандартное переключение на резервную модель при отказах.

Наука, длинный контекст, изображения и управление компьютером

Официальная таблица включает научные исследования, математику, обработку длинного контекста, анализ графиков и видео, а также выполнение задач в компьютерных приложениях. Результаты показывают разные сильные стороны моделей: Argon лидирует в ряде исследовательских и мультимодальных испытаний, но уступает Astra в научной работе через терминал и в выбранной части OSWorld 2.0.

Тест и что он проверяет Gemini 4 Argon GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5
Terminal-Bench Science 0.1 – исследовательские задачи через терминал в естественных, математических и инженерных науках. 57,6% 68,1% 52,6% 63,3%
LABBench 2 – задачи биологических исследований, включая работу с литературой, данными, иллюстрациями и последовательностями. 88,8% 85,4% 68,6% 73,1%
RiemannBench – сложные математические задачи исследовательского уровня, требующие глубоких рассуждений и новых подходов. 76,0% 72,0% 65,6% 69,6%
GraphWalks, до 128 тысяч токенов – обход графа в ширину по большому списку связей. Метрика F1 учитывает точность и полноту найденного набора узлов. 99,7% 98,7% 91,4% 90,6%
GraphWalks, от 256 тысяч до 1 млн токенов – та же задача обхода графа в ширину, но с существенно более длинным входным материалом; метрика F1. 84,2% 71,8% 65,0% 66,8%
Agent's Last Exam – продолжительные профессиональные задачи с проверяемым результатом. В таблице показана доля полностью выполненных задач. 39,5% 34,2% – 38,2%
OSWorld 2.0 – многошаговая работа в компьютерных приложениях. Здесь приведён частичный зачёт только для офлайн-поднабора. 69,2% 72,6% – –
Chartography – понимание профессиональных графиков и диаграмм, требующее визуального анализа и предметных знаний. 71,6% 71,0% 46,2% 66,3%
LVBench – понимание длинных видеозаписей и извлечение сведений из событий, происходящих в разные моменты видео. 91,7% 87,5% 79,7% 83,7%

Прочерк означает отсутствие сопоставимого результата, а не нулевую оценку. В частности, частичный зачёт OSWorld 2.0 нельзя напрямую сравнивать с полным прохождением Agent's Last Exam.

Близкие результаты тоже требуют осторожной интерпретации. Например, преимущество Argon над Astra в Chartography составляет только 0,6 процентного пункта. Одна такая строка не доказывает заметного превосходства во всех задачах визуального анализа.

В каких условиях Google проводила тесты

В методике Google по умолчанию используются Gemini API, максимальная глубина рассуждения и pass@1 – успех с одной попытки, без голосования и параллельного отбора ответов. Небольшие наборы усредняются по нескольким прогонам. Данные конкурентов частично взяты у разработчиков и из рейтингов.

  • DeepSWE: агентная среда mini-swe-agent.
  • PostTrainBench v1.1: OpenCode, 10 часов на одном GPU H100; четыре базовые модели и семь тестов.
  • Terminal-Bench Science: тайм-аут проверяющей программы для Argon увеличен в шесть раз.
  • LABBench 2: терминал Linux, биоинформатические инструменты, Python, R и интернет.
  • GraphWalks: 650 задач до 128 тысяч токенов и 200 задач от 256 тысяч до миллиона.
  • Agent's Last Exam: ALE-Claw, пять часов, включённые фильтры безопасности, полный зачёт.
  • OSWorld 2.0: частичный зачёт офлайн-набора, лучший из трёх прогонов; снимки экрана 1080p, до 500 шагов, Gemini CUA, параллельные пакетные вызовы, сжатие истории, pyautogui, патч от 08.08. Результаты Anthropic объединяют онлайн- и офлайн-наборы, поэтому исключены.
  • Chartography и LVBench: без инструментов. В LVBench Gemini получает один кадр в секунду, Astra – 800 кадров, Fable – 300, Opus – 600 из-за ограничений API.

Различия в настройках и доступных кадрах ограничивают прямое сравнение моделей.

Киберзащита: исправление уязвимостей и проверка веб-приложений

Google обучала Argon обнаруживать, подтверждать и исправлять уязвимости. Проверенным специалистам и собственным внутренним командам компания намерена предоставлять модель без специализированных ограничений на киберзадачи, чтобы они могли использовать её возможности для защиты систем.

На CWE-bench v1 Argon получила 68% и разделила лучший результат с GPT-6 Astra. В полном рейтинге такой же показатель есть у Grok 4.7. Тест выдаёт агенту репозиторий без готового указания на уязвимость: нужно провести аудит и подготовить исправление, которое блокирует эксплуатацию и сохраняет работу программы.

Тест Gemini 4 Argon GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5
CWE-bench v1, программная проверка, pass@1 68,0% 68,0% 58,0% 67,0%

Google также опубликовала два сравнения с Gemini 3.8 Flash Cyber. Они измеряют обнаружение уязвимостей и отличаются от CWE-bench, где проверяется качество исправлений.

Тест и что он проверяет Gemini 4 Argon Gemini 3.8 Flash Cyber
Real-world Vulnerability Discovery – внутренний набор Google с подтверждёнными историческими уязвимостями в открытых проектах на 20 языках. Агент получает исходный код; оценивается полнота обнаружения. 85,8% 71,0%
Wiz Penetration Test Benchmark – внутренний тест поиска и подтверждения уязвимостей веб-приложений без доступа к исходному коду. 70,9% 58,2%

Разница составляет 14,8 и 12,7 процентного пункта соответственно. Эти показатели опубликованы Google для конкретных внутренних наборов и не означают, что модель обнаружит такую же долю проблем в любом проекте.

В официальном анонсе Google сообщает, что компания Wiz уже применяет Argon в программе Scan for Good, которая бесплатно помогает защищать критически важную общественную инфраструктуру. По заявлению Google, модель обнаружила критическую уязвимость в медицинском ПО, используемом больницами разных стран: ошибка могла раскрыть конфиденциальные персональные сведения. Название продукта и технические подробности компания в анонсе не привела.

Защита от скрытых инструкций и контроль действий агента

Перед широким запуском Google усиливает защиту в четырёх направлениях:

  • Предотвращение злоупотреблений. Компания совершенствует фильтры и наблюдение за внутренними активациями модели, чтобы выявлять попытки применения Argon для кибератак и химических, биологических, радиологических или ядерных угроз. Защиту проверяют внутренние и внешние специалисты ручными и автоматизированными атаками.
  • Устойчивость к подмене инструкций. Google использует автоматизированные атакующие проверки и обучение на подобных примерах, чтобы агент сохранял исходную задачу при обработке недоверенных материалов.
  • Контроль отклонений от намерений пользователя. Системы наблюдают за рассуждениями и действиями Argon и могут остановить выполнение. Во время обучения похожая система отправляла предупреждения группе реагирования. Google старалась не возвращать результаты такого наблюдения в обучение, чтобы не приучать модель обходить контроль.
  • Изоляция среды. Перед обучением и проверками повышенного риска компания усиливает защиту песочниц и ограничивает связи с внешними системами.

Косвенная подмена инструкций, или indirect prompt injection – атака через содержимое, которое читает агент: письмо, сайт, документ или репозиторий. Внедрённые указания пытаются заставить его выполнить действия, которых пользователь не поручал.

В тесте Gray Swan IPI проверяется устойчивость агентов к таким атакам. На опубликованном Google графике Argon показывает 0,7% успешных атак при 15 попытках. Здесь меньшее значение лучше; результат не означает полной защиты.

Модель Успешные атаки при 15 попытках
Gemini 4 Argon0,7%
Claude Opus 5.51,0%
Claude Fable 5.11,0%
Claude Opus 54,6%
Gemini 3.8 Flash5,5%
Gemini 3.8 Flash Cyber6,0%
GPT-6 Astra8,5%
GPT-6 Sol10,1%
Muse Spark 1.315,9%
GPT-5.6 Sol27,0%
GLM 5.331,5%
Grok 4.651,8%
Kimi K352,7%

Числа относятся к графику из материалов Google о Fairwind Program. Их нельзя смешивать с результатами других выпусков IPI, где использовались иные атаки или число попыток.

Как Google уже использует Argon

По данным Google, модель применяют тысячи сотрудников для специализированного программирования, исследований и подготовки текстов. Компания описала несколько инженерных примеров.

Оптимизация памяти в дата-центрах. Команда агентов анализировала профили использования памяти и готовила изменения для инфраструктуры Google. После внедрения они освободили более 300 TiB памяти. Общий ожидаемый эффект компания оценивает в 500 TiB – 1 PiB; это прогноз, отдельный от уже полученного результата.

Квантовые алгоритмы. Argon помогает уменьшать совокупные затраты кубитов и логических операций в подпрограммах квантовых вычислений. В одном примере, по заявлению Google, модель за несколько минут улучшила опубликованный базовый результат на 40%.

Перенос проектов с C и C++ на Rust. Агенты работают с проектами от библиотек RE2 и libgav1, содержащих десятки тысяч строк, до ядра Zircon операционной системы Fuchsia с более чем 800 тысячами строк. Google подчёркивает, что перед внедрением такие изменения проходят автоматизированный и ручной аудит, тестирование с эмуляцией и проверку специалистами.

Ускорение видеодекодера libgav1. В существующем переносе на Rust агенты заменили 32 тысячи строк SIMD-кода. Они проводили эксперименты с профилированием и изучали вывод компилятора, чтобы безопасный Rust-код автоматически векторизовался. По измерениям Google, полученный декодер работает в 2,7 раза быстрее исходного переноса на Rust и выдаёт идентичное видео. Сравнение относится именно к прежней Rust-версии: Google говорит о приближении к оптимизированной реализации на C++, а не о её превосходстве.

Цены Gemini 4 Argon API

В анонсе Google указаны вводные и последующие цены API. Это объявленные условия будущего запуска, а не подтверждение общедоступности модели.

Операция Вводная цена за 1 млн токенов После вводного периода
Обычные входные токены 2 $ 4 $
Выходные токены 10 $ 20 $
Кэшированные входные токены 0,10 $ – расчёт при объявленной скидке 95% Отдельный тариф не уточнён

Дата окончания вводного периода не названа. Его завершение увеличит обычные входные и выходные тарифы вдвое. Стоимость конкретной задачи будет зависеть от количества обработанных токенов и продолжительности работы агента; цена за миллион токенов сама по себе не определяет итоговый счёт.

Где Gemini 4 Argon уже доступна, а где запуск ещё ожидается

По состоянию на Google различает ограниченный доступ для проверенных участников и будущий широкий запуск. Формулировка о скором распространении не означает, что Argon уже появилась у всех подписчиков или разработчиков.

Канал или группа пользователей Статус Условия
Внутренние команды Google Уже используют Компания описала действующие инженерные и исследовательские применения.
Отдельные партнёры Fairwind Program и проверенные тестировщики Ограниченный доступ уже предоставляется Google выбирает и проверяет участников; членство в программе не означает автоматический доступ каждого партнёра к Argon.
Wiz, программа Scan for Good Уже использует Применение для киберзащиты подтверждено в анонсе Google.
CodeMender для выбранных участников Fairwind Предусмотрен доступ к Argon Модель можно использовать отдельно или вместе с агентом исправления уязвимостей. Общий доступ к CodeMender сам по себе не открывает Argon.
Gemini Enterprise для одобренных участников Fairwind Предусмотрен управляемый доступ Страница программы описывает прямой доступ к управляемой модели и поддержку режима без хранения данных запросов.
Подписчики Google AI Ultra Запуск анонсирован, дата не названа Одна из первых групп будущего широкого запуска. Наличие подписки пока не подтверждает доступ к Argon.
Обычные платные клиенты Gemini API Запуск анонсирован, дата не названа В публичном каталоге Gemini API на дату проверки Argon отсутствует.
Бесплатный Gemini и подписчики Google AI Pro Общедоступность не объявлена Google не сообщила отдельные сроки или условия доступа этих пользователей.
Общий доступ в Google AI Studio Публичная доступность не подтверждена Общедоступная модель и её идентификатор не опубликованы в проверенном каталоге Gemini API.
Обычные корпоративные клиенты вне Fairwind Широкий запуск ещё ожидается Нельзя переносить условия доступа одобренных партнёров на всех клиентов Google Cloud или Gemini Enterprise.

Условия ограниченного доступа изложены на странице Fairwind Program, планы широкого запуска – в официальном анонсе. В публичном каталоге Gemini API, обновлённом 1 октября, модель пока не перечислена.

Для Fairwind приоритет имеют государственные организации, операторы критической инфраструктуры и ключевые технологические платформы. Принимаются также заявки исследовательских лабораторий. Участники проходят проверку, ограничивают доступ профильными командами, используют устойчивую к фишингу многофакторную аутентификацию и учитывают действия сотрудников. Перепродажа или передача доступа запрещена. Подать заявку можно со страницы программы; фиксированный срок рассмотрения не указан.

Снятие специализированных ограничений на киберзадачи сохраняет требования программы: разрешены защитные исследования, анализ вредоносного ПО и согласованное моделирование угроз. Создание вредоносного ПО не допускается.

Для обычного пользователя следующий подтверждённый этап – объявление запуска для Google AI Ultra и платных клиентов API. Региональные условия, пользовательские лимиты и точная дата этого этапа пока не опубликованы.

Автор:
Комментарии и отзывы

Нашли ошибку?

Новое на сайте