Anthropic выпустила Claude Opus 5 – модель, которая приближается к уровню интеллекта флагманской Fable 5 при вдвое меньшей цене. На тестах программирования и интеллектуального труда, таких как Frontier-Bench и GDPval-AA, Opus 5 показывает лучший на сегодня результат, уступая Mythos 5 лишь на задачах кибербезопасности. Модель стала стандартной в Claude Max и самой мощной в тарифе Claude Pro. Цена осталась прежней относительно Opus 4.8 – 5 $ за миллион входных токенов и 25 $ за миллион выходных.

Frontier-Bench, ARC-AGI 3 и другие бенчмарки

Прирост Opus 5 зависит от выбранного уровня усилий (effort): при высоких значениях модель расходует больше токенов и отвечает тщательнее, при низких – экономит их ради скорости и цены. Сильнее всего преимущество проявляется на инженерных задачах.
Уровень усилий (effort) – настройка, определяющая, сколько токенов модель расходует на задачу. Высокие значения дают более тщательный, но дорогой и медленный ответ, низкие – быстрый и дешёвый.
На Frontier-Bench v0.1 Opus 5 превосходит все остальные модели и более чем вдвое превышает результат Opus 4.8 – при меньшей стоимости за задачу. На CursorBench 3.2 при максимальном усилии (max) модель отстаёт от пикового результата Fable 5 всего на 0,5%, но обходится вдвое дешевле за задачу; на уровнях high, xhigh и max у неё лучшее соотношение цены и результата среди всех моделей.
Схожая картина на задачах интеллектуального труда. На ARC-AGI 3, где встречаются незнакомые модели задачи, результат Opus 5 втрое выше ближайшего конкурента. На Zapier AutomationBench, который проверяет способность довести деловую задачу от начала до конца, доля успешных прохождений примерно в 1,5 раза выше, чем у следующей за ней модели при той же цене, – и даже на минимальном усилии Opus 5 проходит больше задач, чем любая другая модель. На бенчмарке использования компьютера OSWorld 2.0 модель обходит все остальные при любой заданной стоимости и превосходит лучший результат Fable 5 примерно за треть цены.
Прирост в органической химии и биоинформатике
На научных задачах Opus 5 опережает Opus 4.8 во всех тестах Anthropic по наукам о жизни – от структурной биологии до органической химии и биоинформатики. Заметнее всего разница в органической химии: при выводе структуры молекул из спектроскопических данных Opus 5 набирает на 10,2 процентного пункта больше, чем Opus 4.8, по внутреннему бенчмарку компании. На задачах, связанных с белками – например, предсказании того, как изменения в последовательности белка влияют на его функцию, – разница составляет 7,7 процентного пункта.
Самопроверка решений: примеры из Frontier-Bench и раннего доступа
Заметное изменение относительно Opus 4.8 – модель тщательнее проверяет собственную работу и дорабатывает решение до рабочего состояния. В тестах и раннем доступе это проявилось в нескольких показательных случаях.
В одной из задач Frontier-Bench модели дали чертёж детали машины и попросили написать код, воссоздающий её как трёхмерную модель во FreeCAD. Прямого доступа к изображению чертежа при этом не было. Opus 5 написала собственный конвейер компьютерного зрения, который извлёк геометрию из сырых пикселей, и по нему восстановила деталь целиком. При тех же условиях повторить это не смогла ни одна конкурирующая модель даже за пять попыток.
На реальной ошибке в популярном менеджере пакетов с открытым исходным кодом Opus 5 выявила корневую причину и краевой случай, пропущенный в патче сообщества. Другая модель ограничилась внешним симптомом и сообщила, что ошибка устранена, хотя корень проблемы остался.
Инженер трейдинговой фирмы с помощью Opus 5 за одну сессию настроил приём рыночных данных с новой биржи – задачу, которую прежние модели не выполняли даже при подробном плане. Не найдя живого потока данных для сверки, Opus 5 дополнительно собрала собственный тестовый каркас для проверки того, что код корректно разбирает данные биржи.
Согласованность и следование принципам Claude
По результатам автоматизированного поведенческого аудита перед выпуском Opus 5 названа самой согласованной (alignment) моделью Anthropic на сегодня. Она точнее следует «Конституции» Claude, чем Opus 4.8, Sonnet 5 и Fable 5, реже прибегает к обману и хуже поддаётся попыткам склонить её к злоупотреблению. По части безрассудных действий с труднообратимыми последствиями это тоже самая аккуратная модель компании. На общем показателе несогласованного поведения Opus 5 набирает 2,3 – наименьшее значение среди недавних моделей Anthropic (чем ниже, тем лучше).
Согласованность (alignment) – соответствие поведения модели заложенным в неё принципам и намерениям разработчиков. Чем выше согласованность, тем реже модель отклоняется от них и поддаётся попыткам злоупотребления.
Кибербезопасность: поиск уязвимостей без эксплойтов
В опасных возможностях двойного назначения Opus 5 не совершает прорыва. На строгих проверках вместе с частными и государственными партнёрами модель осталась позади Mythos 5 и в исследованиях по биологии, и в наступательной кибербезопасности. Как и Opus 4.8, Opus 5 намеренно не обучали на кибератакующих задачах, но за счёт общего роста способностей она заметно продвинулась и в них.
По поиску уязвимостей Opus 5 приблизилась к Mythos 5, однако в их эксплуатации – то есть превращении уязвимости в реальную угрозу – отстаёт значительно. Это видно на кибербенчмарке OSS-Fuzz: уязвимости обе модели находят примерно одинаково успешно, но по разработке эксплойтов результат Opus 5 далёк от Mythos 5.
Защитные ограничения близки к тем, что применялись в Opus 4.8, с более жёсткими барьерами на узком наборе кибербезопасных задач. Кибер-классификаторы Opus 5 менее строгие, чем у Fable 5: они разрешают искать уязвимости в исходном коде, но блокируют сканирование по бинарным файлам (метод, чаще связанный со злоумышленниками), тестирование на проникновение и генерацию эксплойтов. По оценкам Anthropic, срабатывать они будут примерно на 85% реже, чем у Fable 5. В claude.ai, Claude Code и Claude Cowork помеченные запросы по умолчанию возвращаются к Opus 4.8; в API возврат к резервной модели можно включить отдельно. Участникам программы проверки в сфере кибербезопасности (Cyber Verification Program, CVP) доступна версия Opus 5 с меньшим числом ограничений.
Биология: научные задачи и маршрутизация запросов
Набор ограничений в биологии у Opus 5 такой же, как у Opus 4.8, поэтому теперь это самая способная общедоступная модель Anthropic для научных исследований. При этом на долгих автономных исследовательских задачах – там, где, по оценке компании, ИИ несёт наибольшие биологические риски, – у модели остаются существенные ограничения; для такой работы сильнее по-прежнему Mythos 5. Вместе с выпуском Opus 5 биологические запросы, которые блокируются на Fable 5, теперь направляются на Opus 5, а не на Opus 4.8.
Цена, скорость и два обновления в бете
Claude Opus 5 доступна на всех платформах Anthropic. Цена совпадает с Opus 4.8 – 5 $ за миллион входных токенов и 25 $ за миллион выходных. В API модель обозначается как claude-opus-5.
Есть и Быстрый режим (Fast), где Opus 5 работает примерно в 2,5 раза быстрее обычного. Как и у Opus 4.8, он стоит вдвое дороже базовой цены на Claude Platform, а в Claude Code оплачивается из кредитов на использование. Требований к хранению данных при общем доступе, как и у прежних моделей Opus, нет.
Вместе с моделью вышли два обновления в статусе беты. Первое – смена набора инструментов по ходу разговора на Claude Platform: теперь разработчики могут менять доступные Claude инструменты, не сбрасывая кэш промптов. Второе – автоматический возврат к резервной модели в API: запросы, помеченные классификаторами безопасности на Opus 5 или Fable 5, можно автоматически направлять на другую модель, и тогда запрос по умолчанию уходит на лучшую доступную модель, а не блокируется.
Заключение
С выходом Opus 5 тариф Opus получает результат уровня Fable 5 на программировании и интеллектуальном труде – при вдвое меньшей цене и с настраиваемым расходом токенов. Для повседневной работы – кода, автоматизации, научных расчётов – это делает модель основным рабочим инструментом в Claude Max и Claude Pro. Прежние ограничения по кибербезопасности и долгим автономным биологическим задачам сохраняются: там по-прежнему впереди Mythos 5.
