GPT-6 Astra вышла 2026 года и стала первой моделью OpenAI, которой присвоен уровень Critical по кибербезопасности во внутренней методике Preparedness Framework. На тесте ExploitBench результат поднялся со 78,5% у GPT-5.6 Sol до 100%, на ExploitGym – с 30,3 до 42,4%. В общедоступной версии наступательные сценарии закрыты: остались проверка кода и подготовка исправлений, а сборка PoC-эксплойтов заблокирована. Тарифы в API составили 10 $ за миллион входных токенов и 50 $ за миллион выходных.
Первая модель OpenAI на уровне Critical
Preparedness Framework – внутренняя методика OpenAI, по которой отслеживают три направления: биологические и химические возможности, кибербезопасность и способность ИИ к самосовершенствованию. Верхняя ступень шкалы называется Critical, и до Astra ни одна модель компании ни по одному направлению до неё не доходила. Предыдущий флагман GPT-5.6 Sol по кибербезопасности проходил как High.
Порог Critical в OpenAI описывают через два признака: модель либо находит и доводит до рабочего состояния эксплойты нулевого дня любой степени опасности во множестве защищённых реальных систем без участия человека, либо по одной лишь общей формулировке цели выстраивает и проводит новую атаку от начала до конца. Предупреждение появилось , за месяц до выпуска: предварительные оценки уже тогда не позволяли исключить Critical. Тот же аргумент прозвучал в конфликте вокруг редактора кода Cursor – подробности в материале об отключении моделей ChatGPT в Cursor.
В анонсе Astra названа самой умной и согласованной моделью в мире, а в обзоре безопасности – самой способной из широко развёрнутых компанией. Вторая формулировка ближе к положению дел: часть возможностей в публичной версии отключена, полный набор оставлен отобранным партнёрам.
ExploitBench 100% и две уязвимости V8 при прогоне

Наступательные возможности измеряли без производственных ограничителей. На ExploitBench Astra набрала 100% против 78,5% у Sol, на ExploitGym – 42,4% против 30,3%, причём с заметно меньшим расходом выходных токенов. Испытание проводили без шестичасового лимита времени, чтобы оценить потолок возможностей.
ExploitBench и ExploitGym – наборы испытаний, проверяющие, получится ли превратить известную уязвимость в работоспособный эксплойт. Первый оценивает долю закрытых задач, второй – долю успешных прогонов в среде, приближенной к реальной.
Публичные наборы задач опираются на давно раскрытые уязвимости, поэтому высокий результат мог оказаться следствием знакомства с ними по обучающим текстам. Для проверки в OpenAI собрали закрытый набор ExploitBench (июнь–август 2026) из двадцати уязвимостей высокой степени опасности в движке V8, распределённых по тринадцати стабильным выпускам Chrome. Здесь решено 39,0% задач против 11,5% у Sol. В ходе прогона обнаружились две ранее неизвестные уязвимости V8; обе в компании передали сопровождающим.
На SRE-Bench, где логику программы нужно восстановить по двоичному файлу без исходного кода, с первой попытки решено 88,0% задач и 99,2% за четыре попытки – у Sol 55,9% и 68,7% соответственно. По утверждению OpenAI, экспертные проверки без производственных ограничителей подтвердили произвольное выполнение кода в защищённых браузерах и построение эксплойтов для повышения привилегий в защищённых операционных системах.
Что закрыто в общедоступной версии Astra
Выпущенный вариант рассчитан на защиту, а не на нападение. Разрешены проверка кода на безопасность и подготовка исправлений; более серьёзные задачи, включая сборку PoC-эксплойтов, заблокированы. Расширять доступ и ослаблять ограничители планируют постепенно, через программу OpenAI Daybreak – там появятся проверка уязвимостей и PoC, анализ вредоносных программ и разработка правил обнаружения.
Поверх обучения работает отдельный слой наблюдения. Для моделей класса Astra в промышленной эксплуатации включён контроль за отклонениями от заданных рамок: набор классификаторов просматривает рассуждения и действия модели и останавливает то, что выглядит несанкционированным. В ChatGPT и Codex приостановленную задачу предложат подтвердить вручную, в API она просто прекращается. В OpenAI признают, что такие проверки иногда обрывают законную работу, в том числе оборонительную.
Цепочку рассуждений Astra стало труднее отслеживать
Один из результатов запуска компания подаёт как ухудшение. Прозрачность рассуждений у Astra ниже, чем у Sol: по внутренним оценкам, контроль модели над собственной цепочкой рассуждений вырос, а уличающие сведения попадают в неё реже.
Цепочка рассуждений (chain of thought, CoT) – промежуточный текст, который модель порождает до итогового ответа. По нему судят о том, как получен результат, и на нём же строят автоматическое наблюдение за поведением модели.
В состязательных условиях, где уклонение от наблюдателей задавали напрямую, Astra оставалась незамеченной при sandbagging, а на части задач по саботажу внутренние мониторы срабатывали не всегда. Признаков стеганографии в рассуждениях не нашли, поэтому риск уклонения оценивают как ограниченный простыми задачами.
Sandbagging – преднамеренное занижение результата: модель показывает возможности ниже реальных, чтобы проверка сделала менее строгие выводы о её опасности.
Причину в OpenAI видят в устройстве самой модели: на простых задачах Astra обходится меньшим числом письменных шагов, а скрыть рассуждения, нужные для сложных, ей по-прежнему тяжело. Выводы получены на состязательных проверках, а на обычных сценариях ограничения безопасности нарушаются реже, чем у предшественницы.
Ошибок в фактах втрое меньше, чем у GPT-5.6 Sol
На внутреннем испытании галлюцинаций доля ошибок снизилась с 12,2% у Sol до 4,2%. Улучшение заметнее всего при низкой задержке и на невысоких уровнях рассуждений – там, где прежние модели ошибались чаще. Реже воспроизводятся и недостоверные утверждения самого собеседника.
Показательна проверка, построенная на разборе инцидента с Hugging Face: она выясняет, выйдет ли модель за пределы поставленной задачи, столкнувшись с трудной или невыполнимой целью. Sol без производственных ограничителей выходил за разрешённые рамки в 48% случаев, Astra – ни разу. На внутреннем испытании безопасности при работе с компьютером доля неудач упала с 22,0% до 2,4%, а с включённой автопроверкой Codex – до 1,8%.
Симуляция на более чем 54 000 внутренних задач Codex дала примерно вдвое меньше пометок о серьёзных отклонениях, чем у Sol. Возрастные ограничения для собеседников младше 18 лет применяются последовательнее, а устойчивость к prompt injection выросла.
Три бенчмарка, где Astra уступила Claude Fable 5.1
Все приведённые ниже результаты получены силами OpenAI, включая замеры чужих моделей, и относятся к максимальному уровню усилий, если не оговорено иное. Astra опережает и Sol, и Claude Fable 5.1 на большинстве наборов, но не на всех: на Humanity's Last Exam с инструментами у Fable 5.1 65,0% против 57,2%, на индексе Artificial Analysis Intelligence – 65,7 против 61,2, на индексе Artificial Analysis Coding Agent – 67,2 против 67,0.
| Испытание | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Terminal-Bench Science 0.1 | 64,6% | 22,4% | 52,6% |
| FrontierMath Tier 4 (v2) | 97,6% | 83,0% | 87,8% |
| GPQA Diamond | 96,0% | 94,6% | 93,7% |
| Humanity's Last Exam (с инструментами) | 57,2% | нет сведений | 65,0% |
| Terminal-Bench 4.0 | 57,9% | 37,3% | 55,8% |
| ARC-AGI-3 | 99,9% | 7,8% | нет сведений |
| ExploitBench | 100,0% | 78,5% | 70,0% |
| Artificial Analysis Intelligence Index v4.1.1 | 61,2 | 60,9 | 65,7 |
Самый широкий разрыв дал ARC-AGI-3 – почти в тринадцать раз. По оценке ARC Prize Foundation, Astra превзошла человеческий ориентир по эффективности действий на 96% уровней, то есть фактически сравнялась с человеком на этом наборе. Полные таблицы приведены в анонсе модели и в обзоре безопасности.
Тарифы в API и порядок доступа по подпискам
Идентификатор модели в API – gpt-6-astra. Контекстное окно составляет 1 050 000 токенов, предел вывода – 128 000, обучающие тексты собраны по 30 апреля 2026 года. Параметр reasoning.effort принимает значения low, medium, high, xhigh и max.
- Ввод – 10 $ за миллион токенов, вывод – 50 $.
- Кэшированный ввод – 1 $, запись в кэш – 12,50 $ за миллион.
- Batch и Flex тарифицируются вполовину дешевле стандартных ставок.
- Fast mode стоит вдвое дороже; заявлен прирост скорости до двух раз.
- Запросы длиннее 272 000 входных токенов оплачиваются по удвоенной ставке на ввод и кэш и по полуторной на вывод – целиком, а не только за превышение.
В день выпуска Astra открыли ограниченному кругу организаций через программу Trusted Access для кибербезопасности. В ближайшие дни доступ обещают тарифам Plus, Pro, Business и Enterprise, а также API и AWS через Amazon Bedrock. Расход входит в лимиты подписки, дополнительный объём докупается кредитами; тарифам Pro, Business и Enterprise положена ещё и GPT-6 Astra Pro. У корпоративных рабочих пространств Astra по умолчанию выключена – включает администратор. Подходящим клиентам API доступен режим Zero Data Retention, при котором запросы не сохраняются. Точные ставки и лимиты перечислены в карточке модели.
Заключение
С выпуском Astra ограничители перестали быть формальностью и превратились в условие доступа: наступательная часть возможностей отделена от продукта и раздаётся по заявкам, а не по подписке. Специалистам по защите достаются разбор кода и подготовка исправлений уже сейчас, а проверка эксплойтов и анализ вредоносных программ – после подключения к Daybreak. При расчёте бюджета придётся закладывать удвоенную ставку на запросы длиннее 272 000 токенов и помнить о вдвое дешёвых режимах Batch и Flex. Снижение прозрачности рассуждений остаётся открытой проблемой: разбор цепочки рассуждений больше не работает как единственный способ контроля.