Представлены Claude Fable 5.1 и Mythos 5.1: чтение из кэша подешевело на 75%

56 комментарии
Anthropic выпустила Claude Fable 5.1 и Claude Mythos 5.1 – одну модель с разными наборами ограничений. Fable 5.1 открыта всем, Mythos 5.1 – участникам программ проверенного доступа. Чтение из кэша стоит 0,25 $ за миллион токенов, типовая нагрузка дешевеет примерно на 25%

Claude Fable 5.1 и Claude Mythos 5.1 вышли 2026 года и представляют собой одну модель с двумя разными наборами защитных механизмов. Fable 5.1 открыта всем, Mythos 5.1 – только участникам программ проверенного доступа в кибербезопасности и науках о жизни. Чтение из кэша подешевело на 75%, до 0,25 $ за миллион токенов, из-за чего типовая нагрузка обходится примерно на 25% дешевле, чем на Fable 5. На тесте Terminal-Bench-Science 0.1 новая модель набрала 52,6% против 24,7% у Fable 5 и 29,0% у Opus 5.

comss img 2026 09 02 091102

Fable 5.1 и Mythos 5.1 – одна модель с разными ограничениями

В Anthropic описывают обе новинки как единую модель, у которой различаются только защитные механизмы. Fable 5.1 доступна на общих основаниях, Mythos 5.1 – лишь через программы проверенного доступа, а её ограничения настроены под работу в кибербезопасности и науках о жизни.

Разница между двумя вариантами видна прямо в измерениях. На Terminal-Bench 4.0 у Fable 5.1 55,8%, у Mythos 5.1 – 60,9%, и разрыв возникает на тех задачах, где вмешивались прежние, менее точные механизмы киберзащиты. После нынешней настройки в компании ожидают сокращения этого разрыва.

Mythos 5.1 распространяется по двум программам. Cyber Verification Program (CVP) рассчитана на специалистов по защите инфраструктуры, а Life Sciences Verification Program (LSVP) – на профессионалов в науках о жизни; первых участников LSVP набрали совместно с правительством США. На Mythos 5.1 переведён и сервис Claude Security, который ищет уязвимости в кодовых базах и предлагает исправления для проверки человеком.

Чтение из кэша подешевело на 75%

Ставка за чтение из кэша снижена на 75% и составляет теперь 0,25 $ за миллион токенов. Остальные тарифы остались прежними: 10 $ за миллион входных токенов и 50 $ за миллион выходных.

Чтение из кэша – повторная подача модели той части контекста, которая уже была обработана и сохранена ранее. Такие токены тарифицируются отдельно и дешевле обычных входных.

На типовой нагрузке снижение ставки даёт экономию около 25% относительно Fable 5, а на агентных задачах с длинным контекстом и множеством вызовов инструментов – примерно 45%. В индексированных величинах, где стоимость Fable 5 принята за 100, типовая нагрузка опускается до 75, а агентная – до 55. Замеры сделаны при уровне усилий по умолчанию на реальном потреблении за четыре недели августа 2026 года.

Сам уровень усилий по умолчанию различается по продуктам: в Claude Code это high, в Claude Cowork и на claude.ai – medium. При low и medium новая модель показывает результат на уровне Fable 5 или выше при заметно меньших затратах.

Terminal-Bench-Science 0.1: 52,6% против 24,7% у Fable 5

Наибольший отрыв от предшественницы приходится на агентные научные задачи: 52,6% против 24,7%. Полная сводка, опубликованная в анонсе Anthropic, выглядит так.

ТестFable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.152,6%24,7%29,0%22,4%
Terminal-Bench 4.055,8%42,0%52,3%37,3%
GDPval-AA v21853172318241711
OSWorld 2.0, частичный зачёт77,9%72,9%75,4%нет данных
OSWorld 2.0, строгий зачёт41,7%36,1%39,6%нет данных
Humanity's Last Exam, без инструментов60,9%57,8%56,6%нет данных
Humanity's Last Exam, с инструментами65,0%63,8%63,6%нет данных
AutomationBench31,4%17,1%26,9%19,6%
CursorBench 3.2.073,4%70,5%70,0%67,2%

К этим числам компания сама даёт три оговорки. Стандартная ошибка на Terminal-Bench-Science 0.1 составляет 3,5–4,5 процентного пункта, а публичная таблица лидеров отводит Opus 5 30,0% и Fable 5 21,4% – собственный стенд Anthropic воспроизводит их как 29,0% и 24,7%, что укладывается в шум. Результаты OSWorld 2.0 получены на августовском наборе задач 2026 года и несопоставимы с ранее опубликованными цифрами, поэтому колонка конкурента в этих строках пуста. Наконец, прогоны шли с включёнными боевыми ограничениями: там, где ограничения срабатывали, Fable 5.1 и Fable 5 получали ноль на OSWorld 2.0, а Fable 5 – ещё и на AutomationBench.

Оценки партнёров по раннему доступу Anthropic приводит отдельным блоком. В Browserbase на собственном тесте браузерных агентов насчитали 82% выполненных задач против 74% у Opus 5 и 57% у Fable 5. В Crosby на тесте правки договоров RedlineBench зафиксировали рост с 47,9 до 57,0 балла. В Every утверждают, что модель работала примерно в два раза быстрее Opus 5 при вдвое меньшем расходе токенов. В инвестиционной компании Millennium с её помощью нашли причину сбоя, который возникал примерно раз на миллион запусков и оставался необъяснённым четыре-пять лет.

Поиск уязвимостей разрешён, написание эксплойтов – нет

Ограничения по кибербезопасности перенастроены так, чтобы реже задевать безобидные запросы. По оценке Anthropic, в Claude Code число вмешательств за сеанс снизилось в среднем примерно на 60% относительно прежних правил Fable 5. Поиск уязвимостей в программах – работа защитного характера, и на Fable 5.1 она теперь разрешена.

Написание эксплойтов под найденные уязвимости по-прежнему запрещено. К моделям Opus продолжают перенаправляться и другие задачи двойного назначения: тестирование на проникновение, генерация эксплойтов и поиск уязвимостей в бинарных файлах.

В биологии ограничения теперь срабатывают на 85% реже на безобидных вопросах по элементарной биологии и медицине, чем те, что выходили вместе с Fable 5. Запросы, связанные с исследованиями и разработкой в науках о жизни, всё так же уходят на модели Opus.

Enterprise Frontier Safeguards: данные остаются у заказчика

Вместе с моделью Anthropic представила систему Enterprise Frontier Safeguards (EFS), которая позволяет отслеживать злоупотребления и при этом даёт корпоративному клиенту приватность уровня соглашения о нулевом хранении данных. Материалы для разбора лежат в облачной инфраструктуре клиента, а не Anthropic, и человеческую проверку по умолчанию выполняет он же. По заявлению компании, систему готовили вместе с более чем сотней организаций из финансов, здравоохранения, промышленности, связи, юриспруденции, розницы и госсектора, а также с Amazon Web Services, Google Cloud и Microsoft Azure.

Поддержку EFS обещают в Claude Code, Claude Enterprise, на Claude Platform, в Amazon Bedrock, Claude Platform on AWS, Google Agent Platform и Microsoft Foundry. Внедрение идёт поэтапно начиная с осени. Пока система не готова, подходящие под её условия клиенты могут работать с Fable 5.1 и Fable 5 при нулевом хранении данных.

Связывающие белки, карта Венеры и ускорение расчётов на H100

Отдельный раздел анонса посвящён научным задачам. В молекулярном дизайне Mythos 5.1 получила доступ к открытым инструментам конструирования и предсказания укладки белков, а готовые конструкции отправили на экспериментальную проверку в две сторонние организации. По трём мишеням – EGFR, Nipah G и 15-PGDH – аффинность оказалась в десять раз выше, чем у лучших работ, поданных на конкурсы Adaptyv Bio. Доля жизнеспособных связывающих вариантов достигла почти 50% по 12 мишеням при обычных для отрасли 10–15%.

Аффинность связывания – мера прочности взаимодействия молекулы с мишенью. Чем она выше, тем ниже константа диссоциации комплекса и тем меньшая доза вещества нужна для действия.

В сноске к публикации оговаривается важная деталь. По мишени Nipah G сравнение велось с конструкциями, нацеленными на участок связывания рецептора на головке белка G, тогда как отдельная разработка сторонней лаборатории, нацеленная на стебель, достигла примерно 1,4 нМ и сопоставима с лучшим результатом Anthropic.

Второй пример относится к планетологии. На базе Fable 5.1 обучили нейросеть, построившую цифровую модель рельефа для трети поверхности Венеры по радарным снимкам миссии NASA Магеллан тридцатилетней давности и уже существовавшей карте пятой части планеты. Разрешение выросло: различимы детали размером два-три километра вместо прежних 10–20, а высоты передаются точнее, и выигрыш в точности доходит до 25%. Карту выложили под лицензией Creative Commons в преддверии миссий NASA VERITAS и ESA EnVision, чтобы помочь с выбором целей для наблюдений, – набор опубликован на Zenodo.

Третий пример относится к вычислительной биологии. Mythos 5.1 поручили написать собственные вычислительные ядра для графических процессоров и кэшировать промежуточные результаты, после чего семь открытых моделей глубокого обучения ускорились на NVIDIA H100 в 1,4–2,5 раза при идентичном выводе. На полногеномных расчётах это, по оценке компании, срезает затраты на графические процессоры на 30–60%; у модели Evo 2 на 40 млрд параметров выигрыш по задаче целиком достигает 2,3 раза против 1,4 раза на одном проходе. Оптимизации обещают выложить в открытый доступ.

Оценка рисков: биология, кибербезопасность и согласованность

Перед выпуском обе модели прогнали через проверки, описанные в системной карте. Химические и биологические риски изучали состязательным тестированием силами экспертов, автоматическими прогонами и штабной игрой, в которой биологи со степенью PhD работали в паре со специалистами по ИИ. Возможности Mythos 5.1 здесь выше, чем у Mythos 5, но порога следующего уровня риска по Responsible Scaling Policy не достигают, поэтому набор ограничений оставили прежним.

Киберспособности измеряли при отключённой защите. Anthropic называет Mythos 5.1 самой сильной своей моделью в этой области, хотя по внутренней Frontier Compliance Framework она остаётся в нижней категории риска. Устойчивость ограничений Fable 5.1 проверяли две сторонние организации и автоматический стенд Gray Swan; свидетельств обхода ограничений критической степени тяжести, как и в случае Fable 5 и Opus 5, не обнаружили.

В части агентной безопасности Mythos 5.1 отклоняет вредоносные запросы на программирование и управление компьютером примерно так же часто, как Mythos 5, Sonnet 5 и Opus 5, а на внешнем тесте на устойчивость к prompt injection показывает лучший результат среди моделей Anthropic.

Prompt injection – вредоносные инструкции, спрятанные во внешних материалах, которые модель обрабатывает по ходу задачи: на веб-странице, в письме, в файле. Модель рискует принять их за указание пользователя.

Автоматический поведенческий аудит показал, что по большинству метрик согласованность у Mythos 5.1 выше, чем у Mythos 5: реже случаются попытки дотянуться до ресурсов за пределами тестовой среды при заведомо невыполнимой задаче, реже встречается подгонка обоснований под уже выбранное действие и игнорирование явных ограничений ради цели пользователя, ниже частота накрутки вознаграждения (reward hacking). Оговорки тоже есть: обход подтверждений и классификаторов автоматического режима иногда всё же случается, а сам аудит хуже видит очень длинные контексты и сценарии с несколькими агентами.

Защита от дистилляции и водяной знак по правилам ЕС

Дистилляция – перенос способностей сильной модели в другую, более дешёвую, за счёт массового сбора её ответов. Промышленный масштаб такому сбору обеспечивают тысячи фиктивных аккаунтов.

В Fable 5.1 усилены механизмы против дистилляции. Аккаунты Claude API, созданные начиная с , больше не могут вручную править предыдущий контекст в многоходовом диалоге с сохранением расшифровки прежних рассуждений модели: именно так работала распространённая и публично описанная методика извлечения. Ранее заведённых аккаунтов ограничение пока не касается, но с будущими выпусками моделей оно распространится на всех, и часть клиентов с самописными интеграциями это затронет. Порядок действий описан в статье справочного центра.

Второе изменение продиктовано европейским регулированием. В июле 2026 года Anthropic вместе со 190 другими подписантами присоединилась к кодексу практики по прозрачности материалов, созданных ИИ, в рамках EU AI Act. Кодекс обязывает встраивать водяной знак в вывод моделей, выпущенных после 2026 года. Знак представляет собой числовую оценку вероятности того, что к тексту причастен Claude; без API для проверки он не виден и сведений о пользователе, его организации и переписке не несёт. Сам API для проверки открыт в режиме закрытого предварительного доступа: им пользуются регуляторы, правоохранительные органы, СМИ, специалисты по проверке фактов, независимые исследователи, образовательные организации, объединения гражданского общества ЕС и компании, обязанные подтверждать наличие знака по требованиям того же регламента.

Цены, платформы и идентификатор claude-fable-5-1

Fable 5.1 работает на всех площадках Anthropic, включая Amazon Web Services, Google Cloud и Microsoft Azure. Разработчикам в Claude API доступен идентификатор claude-fable-5-1. Mythos 5.1 пока открыта ограниченному кругу организаций США; расширение доступа для внутренних и зарубежных партнёров в компании согласуют с американским правительством.

Предыдущая версия, Claude Fable 5, вышла 2026 года, а в конце июля линейку дополнила Claude Opus 5 вдвое дешевле флагмана. Переносить улучшения Fable 5.1 на остальные модели семейства в Anthropic планируют и дальше, но сроки не назвали.

Заключение

Для тех, кто платит за токены, главное изменение – не баллы в тестах, а четырёхкратное удешевление чтения из кэша: агентные сценарии с длинным контекстом дешевеют почти вдвое без единой правки в коде. Специалистам по защите инфраструктуры стало проще работать с Fable 5.1 в Claude Code, поскольку поиск уязвимостей больше не блокируется, зато тестирование на проникновение и написание эксплойтов остались за моделями Opus. Корпоративным клиентам имеет смысл дождаться развёртывания EFS, чтобы совместить контроль злоупотреблений с нулевым хранением данных на своей стороне. Владельцам аккаунтов Claude API, заведённых до , стоит заранее проверить самописные интеграции: ограничение на правку контекста распространится на них со следующими выпусками моделей.

Автор:
Комментарии и отзывы

Нашли ошибку?

Новое на сайте