Яндекс выложил в опенсорс Alice AI Foundation LLM – претрейн-версию своей новой большой языковой модели, обученной полностью с нуля. Модель показывает высокие результаты в программировании и способности к рассуждениям, а по качеству ответов на русском языке превосходит многие мировые аналоги – особенно в задачах на знание фактов, интересных русскоязычной аудитории. Она обгоняет в том числе более крупные опенсорс-модели, не требуя при этом больших вычислительных мощностей для инференса. Разработчики могут использовать её как в исследовательских, так и в коммерческих проектах благодаря свободной лицензии Apache 2.0.
Новая модель – это экспериментальная версия, на которой Яндекс тестирует архитектурные решения для своей будущей единой рассуждающей модели (ЕРМ). Рассуждающая модель ляжет в основу агентных возможностей Алисы AI, благодаря которым пользователи смогут поручать ей выполнение конкретных действий. Базовые версии своих моделей компания открывает не впервые: раньше в открытый доступ попали YandexGPT 5 Lite Pretrain и Alice AI Search Pretrain, на которой работают быстрые ИИ-ответы в Поиске.

Сравнение с предыдущей моделью Яндекса Alice AI LLM и открытыми моделями Qwen, NVIDIA и DeepSeek в шести бенчмарках, результат в процентах. Изображение: Яндекс
Качество модели
Alice AI Foundation LLM работает на архитектуре MoE (Mixture of Experts) и включает 80 миллиардов параметров, из которых при обработке каждого токена задействуются только 3 миллиарда – это обеспечивает высокую скорость и экономичность её работы. Контекстное окно модели – до 262 тысяч токенов.
В модель заложены способности к рассуждению и работе в агентных сценариях. За счёт этого она показывает высокую эффективность в сложных логических заданиях и в программировании. Например, на олимпиадных задачах по математике она делит лидерство с Qwen3.5-35B-A3B-Base, решая подавляющее большинство заданий. А в тестах на написание кода превосходит модель Nemotron-3-Super-120B-A12B-Base от NVIDIA – несмотря на то, что использует в четыре раза меньше активных параметров. Умение рассуждать и писать код – необходимый навык для эффективной работы агентов, способных выполнять действия по поручению пользователя.
На задачах, где нужны широкие фактические знания, новая модель при компактном размере обходит и более крупные открытые модели – например, DeepSeek-V4-Flash-Base с 284 млрд параметров и 13 млрд активных. Бенчмарки для оценки знания фактов показывают, что новая модель отвечает на уровне предыдущей закрытой модели Яндекса Alice AI LLM, у которой почти в три раза больше параметров (235 млрд) и примерно в семь раз больше активных.
Новые бенчмарки
Для оценки знаний модели, актуальных для русскоязычных пользователей, Яндекс разработал два собственных бенчмарка – WikiWebFacts и HardMultiQA. Первый состоит из пар «короткий вопрос – короткий ответ» и проверяет знание дат, определений, событий и персоналий на основе материалов онлайн-энциклопедий и частотных агрегированных поисковых запросов.
Второй, HardMultiQA, построен на основе анонимизированного потока запросов к Алисе AI и охватывает более редкие области знаний: от медицины и права до IT и искусства. В этих задачах недостаточно вспомнить один факт: модель должна выбрать несколько верных вариантов из списка, перечислить сразу несколько фактов, подходящих под условие вопроса, или найти фактическую ошибку в тексте.
Новые бенчмарки создавались для оценки знаний модели на русском языке, так как англоязычные бенчмарки не позволяют оценить их объективно. В WikiWebFacts Alice AI Foundation LLM набирает 86,5%, в HardMultiQA – 67,9%, тогда как у DeepSeek-V4-Flash-Base результаты 83,2% и 65,4% соответственно. Оба бенчмарка компания выложила в открытый доступ вместе с моделью, чтобы разработчики и исследователи могли сами воспроизвести результаты и сравнивать между собой любые модели. Вместе с наборами задач компания публикует эталонные ответы и полный протокол оценки.
Инженерные решения
При обучении модели разработчики Яндекса ускорили работу оптимизатора – алгоритма, который на каждом шаге обучения обновляет веса модели. Они перестроили его так, чтобы пересылка данных между видеокартами шла параллельно с вычислениями. В результате время одного шага оптимизатора сократилось примерно вдвое.
Яндекс также оптимизировал подготовку качественных обучающих данных. Для их отбора требовалось оценивать документы с помощью ресурсоёмкой модели, и её запуск на всём корпусе потребовал бы более 200 тысяч часов работы видеокарт. Поэтому перед такой оценкой документы проходят через каскад классификаторов: на каждом этапе более сложная и вычислительно затратная модель работает с меньшим количеством документов. Это позволило в десятки раз сократить объём вычислений и при этом сохранить около 95% полезных документов. Кроме того, инженеры заметно расширили обучающие данные в области права, медицины и математики.
Лицензия и где скачать
Новая модель предоставляется под лицензией Apache 2.0, что позволяет свободно использовать её в коммерческих и исследовательских целях. Она уже прошла основной этап обучения, от которого зависят её эрудированность, способности и потенциал. Это позволяет использовать её как основу для создания собственных проектов.
Вести диалог и следовать инструкциям модель пока не обучена: в карточке модели Яндекс указывает, что это не готовое решение для пользовательских сервисов и перед применением её нужно дообучить под свою задачу. Для этого в репозитории есть шаблон подготовки данных и пример дообучения методом LoRA. Малое число активных параметров сокращает объём вычислений, но в память загружаются все 80 млрд весов, поэтому пример запуска через vLLM в карточке рассчитан на четыре видеокарты.
Веса модели под названием AliceAI-Foundation-80B-A3B-Base и оба бенчмарка опубликованы на Hugging Face, подробный технический отчёт – на Хабре.