Яндекс объявил о публикации Alice AI Search Pretrain – языковой модели, обученной с нуля, на основе которой работают быстрые ИИ-ответы в Поиске. Модель содержит 35 млрд параметров, но при обработке одного токена задействует около 600 млн – примерно 1,7% от общего числа. По заявлению компании, такая архитектура позволяет обслуживать большой поток запросов при сравнительно небольших вычислительных затратах.

Модель разбирает найденные страницы и сводит их в один короткий ответ под поисковой строкой. Изображение: Яндекс
Alice AI Search Pretrain опубликована на Hugging Face под лицензией Apache 2.0. Разработчикам и исследователям доступна базовая версия, прошедшая предварительное обучение. Для генерации ответов непосредственно в Поиске Яндекс использует её дообученный вариант – Alice AI Search. Базовую версию своей модели компания открывает не впервые: в прошлом году в открытый доступ попала YandexGPT 5 Lite Pretrain.
Как устроена модель
Архитектура сочетает Encoder-Decoder и Mixture of Experts (MoE). В схеме «энкодер – декодер» энкодер обрабатывает входной текст и формирует его внутреннее представление, а декодер использует его для генерации ответа. Такое разделение позволяет отдельно организовать обработку исходных материалов и создание выходного текста. Само по себе оно не гарантирует лаконичность: формат ответов также зависит от обучения модели. Принцип работы этой архитектуры описан в документации Hugging Face о T5.
MoE сокращает объём вычислений благодаря выборочной активации нейросетевых блоков – «экспертов». Обучаемый маршрутизатор определяет, какие из них будут обрабатывать конкретный токен. В карточке модели указано, что в каждом MoE-слое 512 экспертов, а на токен выбираются восемь. При этом экспертов не следует буквально воспринимать как специалистов по отдельным предметным областям: их специализация формируется в процессе обучения. Подробнее механизм описан в разборе MoE от Hugging Face.
Из той же карточки видно и то, чего нет в анонсе: у энкодера 16 слоёв, у декодера 12, а контекстное окно составляет 128 тысяч токенов.
Число активных параметров также не равно размеру модели в памяти. Хотя для обработки токена используется около 600 млн параметров, полный набор весов насчитывает 35 млрд. Поэтому требования к оборудованию зависят не только от объёма вычислений, но и от способа хранения весов и организации запуска. Это существенное различие при оценке «компактности» MoE-моделей.
По результатам слепого тестирования, о которых сообщил Яндекс, Alice AI Search Pretrain превосходит Qwen 3.5 2B, Qwen 3.5 4B и T5 Gemma 2 4B-4B Base по качеству русскоязычных ответов. Компания также заявляет о сопоставимом качестве с Qwen 3.5 35B-A3B при меньших вычислительных затратах. Размер тестовой выборки, численные результаты и подробные условия сравнения в анонсе не приведены.
Что уже работает в Поиске
Дообученная Alice AI Search работает в Поиске с июля 2026 года и входит в семейство генеративных моделей Alice AI. Для её настройки разработчики использовали пользовательские сигналы и реальные примеры взаимодействия людей с поисковой системой. Модель формирует краткие ответы, которые появляются непосредственно под поисковой строкой – там же, где Алиса разбирает школьные задания.
По данным Яндекса, быстрыми ответами ежемесячно пользуются более 49 млн человек. Компания называет их своим самым массовым генеративным продуктом. Публикация базовой модели даёт сторонним разработчикам основу для изучения архитектуры и собственного дообучения под прикладные задачи.