SpaceXAI представила Grok 4.7 для программирования и сложных задач

76 комментарии
Новая Grok 4.7 использует более крупную базовую модель и рассчитана на длительную работу с кодом, документами и профессиональными задачами. SpaceXAI сохранила цены Grok 4.6, добавила ускоренный вариант и сообщила об усиленной защите от обхода ограничений и опасных запросов. Модель доступна через API и сторонние платформы

SpaceXAI представила Grok 4.7 – новую модель для программирования, длительных агентных задач и профессиональной работы с документами. Выпуск состоялся . Модель получила более крупную базовую архитектуру, продолжительное обучение с подкреплением и улучшенные механизмы проверки собственных результатов. Grok 4.7 уже доступна в Cursor, Grok Build, через Grok API и сторонние платформы.

Более крупная модель и обучение на длительных задачах

По данным официального анонса SpaceXAI, Grok 4.7 использует новую и более крупную базовую модель по сравнению с Grok 4.6. Компания увеличила продолжительность обучения с подкреплением и усложнила набор заданий, сделав акцент на работе, которая может занимать несколько часов.

Основные изменения направлены на программирование, обработку длинного контекста, проверку выполненной работы и подготовку документов. Модель также обучали взаимодействовать с агентной средой Grok Bot, поэтому улучшения должны проявляться не только в генерации кода, но и в многоэтапных задачах с файлами, терминалом и другими инструментами.

Уровень рассуждений – настройка, определяющая, сколько вычислительных ресурсов модель может потратить на решение. Обозначения Max, xHigh, High, Medium и Low относятся к конкретным моделям и системам запуска: одинаковое название у разных разработчиков не гарантирует одинаковый объём вычислений.

Такие среды постепенно превращают ИИ-модель из чат-бота в исполнителя, способного читать проект, менять файлы, запускать команды и проверять результат. Похожий подход используется в ChatGPT Work и Codex, где агент получает доступ к рабочей папке, репозиторию и терминалу.

Grok 4.7 в сравнении с Grok 4.6 и другими моделями

SpaceXAI сравнила Grok 4.7 xHigh с Grok 4.6 High, GPT-5.6 Sol Max и Fable 5.1 Max. Более новая Grok превзошла предшественницу во всех семи приведённых тестах, однако не стала лидером каждой дисциплины. Fable 5.1 получила более высокие результаты в CursorBench 4.0, Terminal-Bench 4.0 и HealthBench Professional, а GPT-5.6 Sol немного опередила Grok 4.7 в DeepSWE v1.1 и медицинском тесте.

Показатель Grok 4.7 xHigh Grok 4.6 High GPT-5.6 Sol Max Fable 5.1 Max
Цена миллиона входных токенов 2 доллара 2 доллара 4 доллара 10 долларов
Цена миллиона выходных токенов 6 долларов 6 долларов 20 долларов 50 долларов
CursorBench 4.0 46,3% 40,4% 41,7% 51,8%
DeepSWE v1.1 71,0%* 65,2% 72,7% 70,0%
EEBench 64,0% 53,0% 39,4% 56,4%
AA-Briefcase v1.1 1657 1546 1487 1678
Terminal-Bench 4.0 38,0% 20,3% 37,3% 57,9%
Harvey Legal Agent Benchmark 19,6% 15,8% 2,5% 6,7%
HealthBench Professional 56,7% 48,5% 60,5% 62,1%

* Для результата Grok 4.7 в DeepSWE использовался режим High, а не xHigh. Все остальные результаты Grok 4.7 в таблице относятся к xHigh.

Показатели нельзя складывать в общий рейтинг: тесты измеряют разные виды работы, используют собственные правила оценки и могут запускать модели в разных агентных средах. Результат зависит не только от самой модели, но и от доступных инструментов, ограничений времени, числа попыток и настроек рассуждений.

Что проверяют приведённые тесты

  • CursorBench 4.0 проверяет программирующих агентов на задачах, основанных на реальных сеансах Cursor. Они требуют работы с несколькими файлами, инструментами и неоднозначными запросами.
  • DeepSWE v1.1 оценивает длительную работу над программными проектами. В тест входят задачи из разных репозиториев и языков программирования, подготовленные с учётом риска попадания заданий в обучающие данные.
  • EEBench проверяет проектирование электронных схем: выполнение технических требований, моделирование поведения и подбор компонентов с учётом стоимости.
  • AA-Briefcase v1.1 включает 91 профессиональное задание в составе четырёх многоэтапных проектов. Модели работают с тысячами файлов и создают таблицы, презентации, отчёты и другие материалы.
  • Terminal-Bench 4.0 состоит из 66 сложных задач в терминале, относящихся к программированию, машинному обучению, системному администрированию, безопасности, оборудованию и обработке медиаданных.
  • Harvey Legal Agent Benchmark измеряет способность агента выполнить юридическую работу по материалам дела и подготовить документ, соответствующий всем критериям задания.
  • HealthBench Professional оценивает ответы на сложные медицинские запросы по критериям, составленным врачами. Высокий результат в этом тесте не означает допуска модели к самостоятельной диагностике или лечению.

Рейтинг Elo – относительный показатель, рассчитанный по результатам попарного сравнения работ. Значение 1700 не означает 70% правильно выполненных заданий: его можно сопоставлять только с результатами других участников того же теста и версии.

CursorBench 4.0: результат и среднее число шагов

На отдельной диаграмме SpaceXAI сопоставила качество выполнения заданий CursorBench 4.0 со средним количеством действий агента. При близком результате меньшее число шагов может указывать на более короткий процесс решения, но не заменяет оценку качества.

Модель Уровень рассуждений Результат Среднее число шагов
Fable 5.1 Max 51,8% 128,1
xHigh 51,6% 101,4
High 49,2% 77,2
Medium 46,8% 63,46
Low 45,1% 51,3
Opus 5 Max 46,6% 106,4
xHigh 46,1% 103,1
High 44,7% 86,3
Medium 43,3% 71,7
Low 40,7% 57,0
Grok 4.7 xHigh 46,3% 87,7
High 43,9% 71,3
Medium 41,6% 60,3
Low 33,1% 40,2
GPT-5.6 Sol Max 41,7% 99,0
xHigh 37,7% 54,7
High 35,7% 40,6
Medium 31,1% 31,8
Low 24,6% 20,9
Sonnet 5 Max 34,1% 140,3
xHigh 32,0% 102,0
High 30,8% 85,1
Medium 28,0% 64,5
Low 24,1% 45,8

Grok 4.7 xHigh набрала 46,3% при 87,7 шага на задание. Это немного ниже результата Opus 5 Max, но Grok использовала в среднем на 18,7 шага меньше. Fable 5.1 сохранила лидерство по качеству: от 45,1% в режиме Low до 51,8% в Max.

Профессиональные задачи, офисная работа и расчёт электрических схем

Для оценки работы с профессиональными материалами SpaceXAI привела три дополнительных сравнения. В GDPval-AA и AA-Briefcase используется рейтинг Elo, тогда как EEBench сообщает процентную составную оценку.

GDPval-AA v2.1

Место Модель Уровень рассуждений Рейтинг Elo
1 Fable 5.1 Max 1735
2 Grok 4.7 xHigh 1695
3 Grok 4.6 High 1605
4 GPT-6 Astra Max 1542

AA-Briefcase v1.1

Место Модель Уровень рассуждений Рейтинг Elo
1 Fable 5.1 Max 1678
2 Grok 4.7 xHigh 1657
3 GPT-6 Astra Max 1569
4 Grok 4.6 High 1546

EEBench

Место Модель Уровень рассуждений Результат
1 GPT-6 Astra Max 69,3%
2 Grok 4.7 xHigh 64,0%
3 Fable 5.1 Max 56,4%
4 Grok 4.6 High 53,0%

Grok 4.7 заняла второе место в каждом из трёх сравнений. От Fable 5.1 её отделяют 40 пунктов Elo в GDPval-AA и 21 пункт в AA-Briefcase. В EEBench модель уступает GPT-6 Astra 5,3 процентного пункта, но превосходит Grok 4.6 на 11 пунктов.

Почему результаты агентов требуют проверки

Даже высокий балл не означает, что агент стабильно завершит аналогичную пользовательскую задачу. На результат влияют агентная среда, доступные инструменты, лимиты времени и токенов, а также правила проверки. Например, Terminal-Bench оценивает сочетание модели и запускающего её агента, а не только базовую модель.

Практический пример такой разницы ранее появился при проверке инструкции Microsoft по созданию приложения с помощью GitHub Copilot. Агент сообщил об успешной сборке, однако созданный им переключатель темы приводил к завершению приложения. Код компилировался, но ошибка обнаруживалась только при использовании готовой функции.

Поэтому результаты Grok 4.7 показывают заметный прогресс относительно Grok 4.6 в выбранных тестах, но не доказывают превосходство во всех сценариях программирования, юридической, инженерной или медицинской работы.

Защита от опасных запросов и обхода ограничений

SpaceXAI заявляет о полностью переработанном наборе защитных механизмов. По внутренним тестам компании, Grok 4.7 лучше предыдущих моделей распознаёт запросы, направленные на обход ограничений, и точнее отделяет допустимую работу от опасных действий в областях кибербезопасности и биологии.

В тесте биологической безопасности LatchBio модель получила 62,4%. Эта методика сочетает 61 обычное исследовательское задание и 46 сценариев, в которых биологический риск скрыт в данных или описании задачи. Проверяется не простая реакция на опасные слова, а способность отличить допустимое исследование от потенциально вредоносного.

В собственном тесте HackerBench v0.3 Grok 4.7, по данным SpaceXAI, пропустила 3,3% рискованных запросов двойного назначения и при этом редко отказывала при допустимой работе в области информационной безопасности. Полная методика HackerBench и результаты остальных участников в анонсе не раскрыты, поэтому это число следует рассматривать как заявление разработчика.

Компания также начала предоставлять отдельным партнёрам в области кибербезопасности доступ к возможностям Grok 4.7 для закрытого тестирования и исследований защитных механизмов.

Цена Grok 4.7 и доступные платформы

SpaceXAI сохранила базовые тарифы Grok 4.6. Миллион входных токенов Grok 4.7 стоит 2 доллара, а миллион выходных – 6 долларов. По официальному курсу Банка России на , составляющему 84,1975 рубля за доллар, это около 168 и 505 рублей соответственно.

Компания также предлагает ускоренный вариант с удвоенной скоростью генерации и удвоенной ценой. Его использование обойдётся примерно в 337 рублей за миллион входных и 1010 рублей за миллион выходных токенов. Это расчётный ориентир: оплата API производится в долларах, а фактическая сумма зависит от курса банка, комиссии и налогов.

Вариант Миллион входных токенов Миллион выходных токенов Скорость
Grok 4.7 2 доллара, около 168 рублей 6 долларов, около 505 рублей Стандартная
Grok 4.7 Fast 4 доллара, около 337 рублей 12 долларов, около 1010 рублей По заявлению SpaceXAI, в два раза выше

Модель доступна под идентификатором grok-4.7 через Grok API. Помимо собственного API, её можно использовать в Cursor, Grok Build, сторонних инструментах программирования, сервисах маршрутизации моделей и облачных платформах. Отдельную дату появления Grok 4.7 во всех пользовательских интерфейсах компания не уточнила.

Grok 4.7 заметно опережает Grok 4.6, но не лидирует во всех тестах

Главное изменение Grok 4.7 – не отдельная новая функция, а рост качества при сохранении тарифов предыдущей версии. Наиболее заметен прогресс в Terminal-Bench 4.0, где результат вырос с 20,3% до 38%, и в EEBench – с 53% до 64%. В CursorBench прибавка составила 5,9 процентного пункта.

При этом результаты не подтверждают универсальное лидерство. Fable 5.1 лучше справилась с CursorBench, AA-Briefcase, Terminal-Bench и HealthBench Professional, GPT-5.6 Sol сохранила небольшое преимущество в DeepSWE, а GPT-6 Astra заняла первое место в отдельном сравнении EEBench. Сильной стороной Grok 4.7 остаётся сочетание результатов и более низкой цены API, особенно по сравнению с GPT-5.6 Sol и Fable 5.1.

Автор:
Комментарии и отзывы

Нашли ошибку?

Новое на сайте