Google представила две модели для голосового общения в реальном времени: Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Базовая версия рассчитана на быстрые диалоги и массовое применение, а Extended Thinking получила фоновое рассуждение для сложных многоэтапных задач. Распространение началось в Search Live, Gemini Live, сервисах Google Workspace, Gemini API и Google AI Studio. Корпоративным клиентам модели пока предоставляются в режиме закрытого предварительного тестирования.
Gemini 3.8 Live продолжает разговор во время вызова инструментов
Обе модели относятся к семейству Gemini 3.8 Audio и созданы на базе Gemini 3 Pro. Они принимают текст, аудио, изображения и видео. Максимальный объём входного контекста составляет 131 072 токена, выходного – 65 536 токенов.
Gemini 3.8 Live предназначена для голосовых помощников, которым нужна минимальная задержка без пауз на углублённое рассуждение. По заявлению Google, модель анализирует визуальные данные почти в реальном времени и распознаёт переходы между 97 поддерживаемыми языками непосредственно во время разговора.
Вызовы инструментов и API выполняются в фоне. Модель может подтвердить получение запроса, продолжить диалог и сообщить результат после завершения операции, не останавливая текущую беседу.
Gemini Live API – интерфейс для передачи непрерывного потока аудио, изображений и текста через постоянное соединение WebSocket. Он поддерживает голосовые ответы с малой задержкой, прерывание модели пользователем и вызов внешних инструментов во время сеанса.
Gemini 3.8 Live Extended Thinking рассчитана на задачи, требующие более длительного рассуждения. Google утверждает, что модель способна рассуждать и говорить одновременно: она подтверждает запрос короткой репликой, выполняет многоэтапную работу в фоне и голосом сообщает о ходе выполнения.
В API для Extended Thinking доступны низкий, средний и высокий уровни рассуждения. Модель поддерживает только асинхронные неблокирующие вызовы функций, поэтому разработчикам необходимо продолжать принимать сообщения сервера даже после завершения основного речевого ответа.


Extended Thinking получила 82,6 балла в сводном голосовом тесте
По данным Google и рейтинга Artificial Analysis, Gemini 3.8 Live Extended Thinking с высоким уровнем рассуждения заняла первое место в сводном Speech to Speech Quality Index с результатом 82,6 балла.
- 82,6 балла – сводный Speech to Speech Quality Index;
- 68,6% – выполнение задач голосового помощника в τ-Voice;
- 35,1% – результат в банковских сценариях Sierra τ-Voice-banking, по данным Google;
- 97,7% – рассуждение по аудиозапросам в Big Bench Audio, по данным Google.
Speech to Speech Quality Index – сводный показатель Artificial Analysis с равным весом речевого рассуждения, выполнения агентных задач, пользовательских предпочтений и успешного завершения заданий. Первое место в этом индексе не означает лидерство модели в каждой отдельной дисциплине.
Базовая Gemini 3.8 Live получила 76 баллов в том же сводном индексе и заняла второе место в Speech Agent Arena, где участники сравнивают ответы двух скрытых моделей. Результаты Extended Thinking получены с высоким уровнем рассуждения, поэтому их нельзя автоматически переносить на базовую модель или другие режимы.
Gemini API: 0,005 $ за минуту входящего аудио
Разработчикам доступны стабильные идентификаторы gemini-3.8-live и gemini-3.8-live-extended-thinking. Обе модели можно использовать через Gemini API и Google AI Studio.
В платном тарифе Gemini API обработка входящего аудио стоит 3 $ за 1 млн токенов, или около 0,005 $ за минуту. Исходящее аудио оценивается в 12 $ за 1 млн токенов, или около 0,018 $ за минуту. Для текста установлена цена 0,75 $ за 1 млн входных и 4,50 $ за 1 млн выходных токенов, включая токены рассуждения.
Тарифная таблица не устанавливает отдельную повышенную ставку для Extended Thinking. Однако сложная задача может обойтись дороже из-за большего количества выходных токенов, потраченных на фоновое рассуждение.
Extended Thinking приходит в Gemini Live, Gmail, Документы и Keep


Обычные пользователи получают Gemini 3.8 Live в Search Live, а Extended Thinking – в Gemini Live. Распространение выполняется поэтапно, поэтому новая модель может появиться в аккаунтах не одновременно.
На смартфонах голосовой режим доступен через приложение Google Gemini для Android.
Для устройств Apple используется отдельное приложение Google Gemini для iPhone, которое также поддерживает Gemini Live.
В Google Документах Extended Thinking предназначена для подписчиков Google AI Pro и Ultra. В Gmail и Keep модель заявлена для пользователей всех подписок Google AI. Бизнес-клиенты Google Workspace получат её позднее.
Google недавно выпустила отдельное приложение Gemini для Windows, но в новом анонсе компания не приводит отдельный график появления Gemini 3.8 Live для настольных платформ.
Gemini Enterprise предоставляет обе модели в режиме закрытого предварительного тестирования. Поддержка Gemini Enterprise for Customer Experience заявлена на более поздний срок без точной даты.
Аудио получает метку SynthID, а знания ограничены январём 2025 года
Все аудиозаписи, созданные новыми моделями в продуктах Google, получают цифровую метку SynthID. Она встраивается непосредственно в звуковой сигнал, не должна восприниматься на слух и позволяет инструментам Google определить происхождение записи.
SynthID – технология Google DeepMind для маркировки созданных ИИ изображений, аудио, видео и текста. Незаметная для человека цифровая метка встраивается в содержимое при его создании и позднее может быть обнаружена средствами Google.
В карточке Gemini 3.8 Audio указан предел знаний на январь 2025 года. Модели поддерживают поиск Google через API, но могут допускать фактические ошибки, замедляться или завершать запрос по тайм-ауту. Поэтому Extended Thinking подходит для сложных голосовых задач, но её ответы и действия по-прежнему требуют проверки, особенно при работе с актуальными или чувствительными данными.