SpaceXAI представила Grok 4.7 – новую модель для программирования, длительных агентных задач и профессиональной работы с документами. Выпуск состоялся . Модель получила более крупную базовую архитектуру, продолжительное обучение с подкреплением и улучшенные механизмы проверки собственных результатов. Grok 4.7 уже доступна в Cursor, Grok Build, через Grok API и сторонние платформы.
Более крупная модель и обучение на длительных задачах
По данным официального анонса SpaceXAI, Grok 4.7 использует новую и более крупную базовую модель по сравнению с Grok 4.6. Компания увеличила продолжительность обучения с подкреплением и усложнила набор заданий, сделав акцент на работе, которая может занимать несколько часов.
Основные изменения направлены на программирование, обработку длинного контекста, проверку выполненной работы и подготовку документов. Модель также обучали взаимодействовать с агентной средой Grok Bot, поэтому улучшения должны проявляться не только в генерации кода, но и в многоэтапных задачах с файлами, терминалом и другими инструментами.
Уровень рассуждений – настройка, определяющая, сколько вычислительных ресурсов модель может потратить на решение. Обозначения Max, xHigh, High, Medium и Low относятся к конкретным моделям и системам запуска: одинаковое название у разных разработчиков не гарантирует одинаковый объём вычислений.
Такие среды постепенно превращают ИИ-модель из чат-бота в исполнителя, способного читать проект, менять файлы, запускать команды и проверять результат. Похожий подход используется в ChatGPT Work и Codex, где агент получает доступ к рабочей папке, репозиторию и терминалу.
Grok 4.7 в сравнении с Grok 4.6 и другими моделями
SpaceXAI сравнила Grok 4.7 xHigh с Grok 4.6 High, GPT-5.6 Sol Max и Fable 5.1 Max. Более новая Grok превзошла предшественницу во всех семи приведённых тестах, однако не стала лидером каждой дисциплины. Fable 5.1 получила более высокие результаты в CursorBench 4.0, Terminal-Bench 4.0 и HealthBench Professional, а GPT-5.6 Sol немного опередила Grok 4.7 в DeepSWE v1.1 и медицинском тесте.
| Показатель | Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max |
|---|---|---|---|---|
| Цена миллиона входных токенов | 2 доллара | 2 доллара | 4 доллара | 10 долларов |
| Цена миллиона выходных токенов | 6 долларов | 6 долларов | 20 долларов | 50 долларов |
| CursorBench 4.0 | 46,3% | 40,4% | 41,7% | 51,8% |
| DeepSWE v1.1 | 71,0%* | 65,2% | 72,7% | 70,0% |
| EEBench | 64,0% | 53,0% | 39,4% | 56,4% |
| AA-Briefcase v1.1 | 1657 | 1546 | 1487 | 1678 |
| Terminal-Bench 4.0 | 38,0% | 20,3% | 37,3% | 57,9% |
| Harvey Legal Agent Benchmark | 19,6% | 15,8% | 2,5% | 6,7% |
| HealthBench Professional | 56,7% | 48,5% | 60,5% | 62,1% |
* Для результата Grok 4.7 в DeepSWE использовался режим High, а не xHigh. Все остальные результаты Grok 4.7 в таблице относятся к xHigh.
Показатели нельзя складывать в общий рейтинг: тесты измеряют разные виды работы, используют собственные правила оценки и могут запускать модели в разных агентных средах. Результат зависит не только от самой модели, но и от доступных инструментов, ограничений времени, числа попыток и настроек рассуждений.
Что проверяют приведённые тесты
- CursorBench 4.0 проверяет программирующих агентов на задачах, основанных на реальных сеансах Cursor. Они требуют работы с несколькими файлами, инструментами и неоднозначными запросами.
- DeepSWE v1.1 оценивает длительную работу над программными проектами. В тест входят задачи из разных репозиториев и языков программирования, подготовленные с учётом риска попадания заданий в обучающие данные.
- EEBench проверяет проектирование электронных схем: выполнение технических требований, моделирование поведения и подбор компонентов с учётом стоимости.
- AA-Briefcase v1.1 включает 91 профессиональное задание в составе четырёх многоэтапных проектов. Модели работают с тысячами файлов и создают таблицы, презентации, отчёты и другие материалы.
- Terminal-Bench 4.0 состоит из 66 сложных задач в терминале, относящихся к программированию, машинному обучению, системному администрированию, безопасности, оборудованию и обработке медиаданных.
- Harvey Legal Agent Benchmark измеряет способность агента выполнить юридическую работу по материалам дела и подготовить документ, соответствующий всем критериям задания.
- HealthBench Professional оценивает ответы на сложные медицинские запросы по критериям, составленным врачами. Высокий результат в этом тесте не означает допуска модели к самостоятельной диагностике или лечению.
Рейтинг Elo – относительный показатель, рассчитанный по результатам попарного сравнения работ. Значение 1700 не означает 70% правильно выполненных заданий: его можно сопоставлять только с результатами других участников того же теста и версии.
CursorBench 4.0: результат и среднее число шагов
На отдельной диаграмме SpaceXAI сопоставила качество выполнения заданий CursorBench 4.0 со средним количеством действий агента. При близком результате меньшее число шагов может указывать на более короткий процесс решения, но не заменяет оценку качества.
| Модель | Уровень рассуждений | Результат | Среднее число шагов |
|---|---|---|---|
| Fable 5.1 | Max | 51,8% | 128,1 |
| xHigh | 51,6% | 101,4 | |
| High | 49,2% | 77,2 | |
| Medium | 46,8% | 63,46 | |
| Low | 45,1% | 51,3 | |
| Opus 5 | Max | 46,6% | 106,4 |
| xHigh | 46,1% | 103,1 | |
| High | 44,7% | 86,3 | |
| Medium | 43,3% | 71,7 | |
| Low | 40,7% | 57,0 | |
| Grok 4.7 | xHigh | 46,3% | 87,7 |
| High | 43,9% | 71,3 | |
| Medium | 41,6% | 60,3 | |
| Low | 33,1% | 40,2 | |
| GPT-5.6 Sol | Max | 41,7% | 99,0 |
| xHigh | 37,7% | 54,7 | |
| High | 35,7% | 40,6 | |
| Medium | 31,1% | 31,8 | |
| Low | 24,6% | 20,9 | |
| Sonnet 5 | Max | 34,1% | 140,3 |
| xHigh | 32,0% | 102,0 | |
| High | 30,8% | 85,1 | |
| Medium | 28,0% | 64,5 | |
| Low | 24,1% | 45,8 |
Grok 4.7 xHigh набрала 46,3% при 87,7 шага на задание. Это немного ниже результата Opus 5 Max, но Grok использовала в среднем на 18,7 шага меньше. Fable 5.1 сохранила лидерство по качеству: от 45,1% в режиме Low до 51,8% в Max.
Профессиональные задачи, офисная работа и расчёт электрических схем
Для оценки работы с профессиональными материалами SpaceXAI привела три дополнительных сравнения. В GDPval-AA и AA-Briefcase используется рейтинг Elo, тогда как EEBench сообщает процентную составную оценку.
GDPval-AA v2.1
| Место | Модель | Уровень рассуждений | Рейтинг Elo |
|---|---|---|---|
| 1 | Fable 5.1 | Max | 1735 |
| 2 | Grok 4.7 | xHigh | 1695 |
| 3 | Grok 4.6 | High | 1605 |
| 4 | GPT-6 Astra | Max | 1542 |
AA-Briefcase v1.1
| Место | Модель | Уровень рассуждений | Рейтинг Elo |
|---|---|---|---|
| 1 | Fable 5.1 | Max | 1678 |
| 2 | Grok 4.7 | xHigh | 1657 |
| 3 | GPT-6 Astra | Max | 1569 |
| 4 | Grok 4.6 | High | 1546 |
EEBench
| Место | Модель | Уровень рассуждений | Результат |
|---|---|---|---|
| 1 | GPT-6 Astra | Max | 69,3% |
| 2 | Grok 4.7 | xHigh | 64,0% |
| 3 | Fable 5.1 | Max | 56,4% |
| 4 | Grok 4.6 | High | 53,0% |
Grok 4.7 заняла второе место в каждом из трёх сравнений. От Fable 5.1 её отделяют 40 пунктов Elo в GDPval-AA и 21 пункт в AA-Briefcase. В EEBench модель уступает GPT-6 Astra 5,3 процентного пункта, но превосходит Grok 4.6 на 11 пунктов.
Почему результаты агентов требуют проверки
Даже высокий балл не означает, что агент стабильно завершит аналогичную пользовательскую задачу. На результат влияют агентная среда, доступные инструменты, лимиты времени и токенов, а также правила проверки. Например, Terminal-Bench оценивает сочетание модели и запускающего её агента, а не только базовую модель.
Практический пример такой разницы ранее появился при проверке инструкции Microsoft по созданию приложения с помощью GitHub Copilot. Агент сообщил об успешной сборке, однако созданный им переключатель темы приводил к завершению приложения. Код компилировался, но ошибка обнаруживалась только при использовании готовой функции.
Поэтому результаты Grok 4.7 показывают заметный прогресс относительно Grok 4.6 в выбранных тестах, но не доказывают превосходство во всех сценариях программирования, юридической, инженерной или медицинской работы.
Защита от опасных запросов и обхода ограничений
SpaceXAI заявляет о полностью переработанном наборе защитных механизмов. По внутренним тестам компании, Grok 4.7 лучше предыдущих моделей распознаёт запросы, направленные на обход ограничений, и точнее отделяет допустимую работу от опасных действий в областях кибербезопасности и биологии.
В тесте биологической безопасности LatchBio модель получила 62,4%. Эта методика сочетает 61 обычное исследовательское задание и 46 сценариев, в которых биологический риск скрыт в данных или описании задачи. Проверяется не простая реакция на опасные слова, а способность отличить допустимое исследование от потенциально вредоносного.
В собственном тесте HackerBench v0.3 Grok 4.7, по данным SpaceXAI, пропустила 3,3% рискованных запросов двойного назначения и при этом редко отказывала при допустимой работе в области информационной безопасности. Полная методика HackerBench и результаты остальных участников в анонсе не раскрыты, поэтому это число следует рассматривать как заявление разработчика.
Компания также начала предоставлять отдельным партнёрам в области кибербезопасности доступ к возможностям Grok 4.7 для закрытого тестирования и исследований защитных механизмов.
Цена Grok 4.7 и доступные платформы
SpaceXAI сохранила базовые тарифы Grok 4.6. Миллион входных токенов Grok 4.7 стоит 2 доллара, а миллион выходных – 6 долларов. По официальному курсу Банка России на , составляющему 84,1975 рубля за доллар, это около 168 и 505 рублей соответственно.
Компания также предлагает ускоренный вариант с удвоенной скоростью генерации и удвоенной ценой. Его использование обойдётся примерно в 337 рублей за миллион входных и 1010 рублей за миллион выходных токенов. Это расчётный ориентир: оплата API производится в долларах, а фактическая сумма зависит от курса банка, комиссии и налогов.
| Вариант | Миллион входных токенов | Миллион выходных токенов | Скорость |
|---|---|---|---|
| Grok 4.7 | 2 доллара, около 168 рублей | 6 долларов, около 505 рублей | Стандартная |
| Grok 4.7 Fast | 4 доллара, около 337 рублей | 12 долларов, около 1010 рублей | По заявлению SpaceXAI, в два раза выше |
Модель доступна под идентификатором grok-4.7 через Grok API. Помимо собственного API, её можно использовать в Cursor, Grok Build, сторонних инструментах программирования, сервисах маршрутизации моделей и облачных платформах. Отдельную дату появления Grok 4.7 во всех пользовательских интерфейсах компания не уточнила.
Grok 4.7 заметно опережает Grok 4.6, но не лидирует во всех тестах
Главное изменение Grok 4.7 – не отдельная новая функция, а рост качества при сохранении тарифов предыдущей версии. Наиболее заметен прогресс в Terminal-Bench 4.0, где результат вырос с 20,3% до 38%, и в EEBench – с 53% до 64%. В CursorBench прибавка составила 5,9 процентного пункта.
При этом результаты не подтверждают универсальное лидерство. Fable 5.1 лучше справилась с CursorBench, AA-Briefcase, Terminal-Bench и HealthBench Professional, GPT-5.6 Sol сохранила небольшое преимущество в DeepSWE, а GPT-6 Astra заняла первое место в отдельном сравнении EEBench. Сильной стороной Grok 4.7 остаётся сочетание результатов и более низкой цены API, особенно по сравнению с GPT-5.6 Sol и Fable 5.1.