Сбер выпустил GigaChat 3.5 Reasoning – первую модель в линейке с отдельным режимом рассуждений. Веса и код запуска опубликованы на Hugging Face под лицензией MIT, которая разрешает в том числе коммерческое использование. Попробовать модель можно в веб-версии ГигаЧата: для этого нужно включить режим «Рассуждение».
Новинка построена на базе GigaChat 3.5 Ultra, представленной в июле. Основные изменения касаются обучения: разработчики отдельно обучили модель решать задачи, требующие нескольких последовательных шагов, и проверять свои решения. API-версия для бизнеса появится позже.
Для чего нужен режим рассуждений
В этом режиме модель сначала выстраивает решение по шагам, а затем формулирует итоговый ответ. Она может составить план, проверить промежуточные результаты и вернуться к предыдущему шагу, если обнаружит ошибку. При наличии подключённых инструментов модель также может обращаться к ним в ходе решения.
Такой подход требует дополнительных вычислений и времени, поэтому режим включается вручную. В Сбере предлагают использовать его для разбора договоров, финансовых расчётов, поиска ошибок в коде и планирования поездок с несколькими условиями – например, когда нужно одновременно учесть бюджет, даты и маршрут.
Архитектура и работа с длинным контекстом
GigaChat 3.5 Reasoning использует архитектуру «смесь экспертов» (MoE). Всего у модели 432 млрд параметров, но при обработке каждого токена задействуются 28 млрд. Это позволяет сократить объём вычислений, хотя для хранения весов по-прежнему требуется много памяти.
В архитектуре сочетаются два механизма внимания: Multi-head Latent Attention (MLA) и линейное внимание GatedDeltaNet. Последнее снижает затраты на обработку длинных последовательностей. Максимальное контекстное окно модели составляет 262 тыс. токенов.
Схема архитектуры GigaChat 3.5. Изображение: Сбер
Также модель использует GatedNorm – обучаемый множитель после нормализации RMSNorm – и три головы предсказания следующих токенов (MTP). MTP позволяет предлагать несколько токенов вперёд для спекулятивного декодирования и тем самым ускорять генерацию.
По данным разработчиков, все этапы обучения проходили в FP8. В этом же формате опубликованы основные веса для запуска. Для дообучения и самостоятельного квантования доступна отдельная версия в BF16.
Как обучали модель
После дообучения на готовых примерах разработчики создали шесть специализированных моделей. Каждую обучали с подкреплением по алгоритму CISPO: модель сама генерировала решения, получала оценку и на её основе обновляла веса. Критерии оценки зависели от задачи – от проверки ответа по эталону до запуска тестов или сравнения ответов с помощью другой языковой модели.
| Специализация | Задачи | Как оценивали результат |
|---|---|---|
| STEM | Математика, олимпиадные задачи, естественные науки | Сравнивали итоговый ответ с эталоном |
| Code | Алгоритмы, редактирование кода, генерация тестов | Запускали код |
| Code Agent | Работа с репозиториями, задачи в духе SWE-bench | Запускали тесты после внесения изменений |
| General Agent | Вызов функций, диалог, работа с памятью и поиском | Проверяли конечное состояние среды |
| Диалог | Общение с пользователем | Сравнивали ответы попарно с помощью модели-судьи |
| Следование инструкциям | Соблюдение формата, длинный контекст, структурированный вывод | Проверяли итоговый ответ |
По мере обучения задания усложняли. Перед очередным этапом модель проверяли на обучающем наборе и исключали задачи, с которыми она справлялась более чем в 75% попыток. Так обучение постепенно сосредотачивалось на том, что ещё вызывало трудности.
Затем навыки шести моделей объединили в одной с помощью дистилляции. Итоговая модель генерировала собственные решения, а профильный эксперт оценивал их на уровне отдельных токенов. Это давало более подробную обратную связь, чем одна оценка за весь ответ. Процесс описан в техническом разборе команды Сбера.
Результаты тестов
Сбер сравнил GigaChat 3.5 Reasoning с версией Ultra Instruct без режима рассуждений и с DeepSeek V4 Flash Preview Reasoning. По опубликованным данным, новая модель заметно улучшила результаты в математике, программировании и следовании инструкциям. Ниже приведены отдельные тесты из сравнения.
| Тест | GigaChat 3.5 Ultra Instruct | GigaChat 3.5 Reasoning | DeepSeek V4 Flash Preview Reasoning |
|---|---|---|---|
| AIME 2025 | 68 | 89 | 88,95 |
| AIME 2026 | 67 | 92 | 90,4 |
| HMMT 2025 | 36,67 | 83,13 | 95,21 |
| GPQA-Diamond | 61,11 | 82,32 | 87,4 |
| IFBench | 43,66 | 77 | 73,33 |
| StructEval | 74,35 | 85 | 80,19 |
| Natural Plan | 64 | 80,19 | 88 |
| Live Code Bench v6 | 56,2 | 85,4 | 87,87 |
| SWE-bench Verified | 42,6 | 64,7 | 78,6 |
| Terminal-Bench 2 | 13,48 | 30,3 | 56,6 |
| Arena Hard Ru | 52,8 | 60,7 | 36,8 |
| Ru LLM Arena | 53,8 | 64 | 48,5 |
В сравнении с DeepSeek результаты зависят от задачи. GigaChat немного впереди на AIME 2026, практически на одном уровне на AIME 2025 и показывает более высокие оценки в IFBench, StructEval и двух русскоязычных аренах.
DeepSeek лучше справляется с HMMT, GPQA-Diamond, планированием и задачами на программирование. Особенно заметна разница в работе с репозиториями и терминалом: на SWE-bench Verified она составляет около 14 пунктов, на Terminal-Bench 2 – около 26.
Средние оценки в сводке Сбера составляют 51,47 для Ultra Instruct, 68,88 для GigaChat 3.5 Reasoning и 72,71 для DeepSeek. Эти значения относятся ко всей сводке, а не только к строкам таблицы выше. Все результаты приведены по данным разработчиков.
Сколько токенов уходит на рассуждения
Разработчики также сравнили длину рассуждений на математических задачах. По их оценке, на наборах AIME 2025, AIME 2026, HMMT и IMOAnswerBench модель расходует в среднем на 37% меньше токенов, чем DeepSeek V4 Flash Preview.
| Тест | Задач | GigaChat 3.5 Reasoning, токенов | DeepSeek V4 Flash Preview, токенов | Снижение расхода |
|---|---|---|---|---|
| AIME 2025 | 240 | 13 980 | 19 129 | 27% |
| AIME 2026 | 240 | 13 635 | 17 697 | 23% |
| HMMT | 480 | 13 311 | 19 553 | 32% |
| IMOAnswerBench | 1096 | 17 074 | 29 041 | 41% |
Заявленные 37% учитывают, сколько задач в каждом наборе: больше половины приходится на IMOAnswerBench, где разрыв самый большой. Простое среднее четырёх процентов из последнего столбца дало бы около 31%.
Более короткие рассуждения могут сократить время ожидания и расходы при оплате за токены. Однако фактическая скорость зависит от оборудования и настроек запуска, а стоимость использования через API – ещё и от тарифов сервиса.
Где скачать и что нужно для запуска
На Hugging Face доступны основные веса в FP8, версия в BF16 для дообучения и квантования, а также сборки GGUF с квантованием Q4_K_M и Q6_K.
Для локального запуска потребуется много памяти
Даже квантованные веса занимают сотни гигабайт, поэтому обычный домашний компьютер для этой модели не подойдёт. Разработчики приводят пример запуска FP8-версии на сервере с восемью ускорителями NVIDIA H100.
В опубликованных инструкциях для vLLM и SGLang используются отдельные ветки с поддержкой модели, которые нужно устанавливать вручную. Проще всего познакомиться с GigaChat 3.5 Reasoning через веб-версию ГигаЧата.
