Google представила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking

95 комментарии
Google представила две голосовые модели: Gemini 3.8 Live для быстрых диалогов и масштабных сервисов и Live Extended Thinking для сложных многошаговых задач. Модели работают с аудио, видео и изображениями, доступны в Gemini Live, Search Live, Workspace, Gemini API и Google AI Studio. Сгенерированное аудио получает метку SynthID

Google представила две модели для голосового общения в реальном времени: Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Базовая версия рассчитана на быстрые диалоги и массовое применение, а Extended Thinking получила фоновое рассуждение для сложных многоэтапных задач. Распространение началось в Search Live, Gemini Live, сервисах Google Workspace, Gemini API и Google AI Studio. Корпоративным клиентам модели пока предоставляются в режиме закрытого предварительного тестирования.

Gemini 3.8 Live продолжает разговор во время вызова инструментов

Обе модели относятся к семейству Gemini 3.8 Audio и созданы на базе Gemini 3 Pro. Они принимают текст, аудио, изображения и видео. Максимальный объём входного контекста составляет 131 072 токена, выходного – 65 536 токенов.

Gemini 3.8 Live предназначена для голосовых помощников, которым нужна минимальная задержка без пауз на углублённое рассуждение. По заявлению Google, модель анализирует визуальные данные почти в реальном времени и распознаёт переходы между 97 поддерживаемыми языками непосредственно во время разговора.

Вызовы инструментов и API выполняются в фоне. Модель может подтвердить получение запроса, продолжить диалог и сообщить результат после завершения операции, не останавливая текущую беседу.

Gemini Live API – интерфейс для передачи непрерывного потока аудио, изображений и текста через постоянное соединение WebSocket. Он поддерживает голосовые ответы с малой задержкой, прерывание модели пользователем и вызов внешних инструментов во время сеанса.

Gemini 3.8 Live Extended Thinking рассчитана на задачи, требующие более длительного рассуждения. Google утверждает, что модель способна рассуждать и говорить одновременно: она подтверждает запрос короткой репликой, выполняет многоэтапную работу в фоне и голосом сообщает о ходе выполнения.

В API для Extended Thinking доступны низкий, средний и высокий уровни рассуждения. Модель поддерживает только асинхронные неблокирующие вызовы функций, поэтому разработчикам необходимо продолжать принимать сообщения сервера даже после завершения основного речевого ответа.

comss img 2026 09 16 074057
comss img 2026 09 16 074101

Extended Thinking получила 82,6 балла в сводном голосовом тесте

По данным Google и рейтинга Artificial Analysis, Gemini 3.8 Live Extended Thinking с высоким уровнем рассуждения заняла первое место в сводном Speech to Speech Quality Index с результатом 82,6 балла.

  • 82,6 балла – сводный Speech to Speech Quality Index;
  • 68,6% – выполнение задач голосового помощника в τ-Voice;
  • 35,1% – результат в банковских сценариях Sierra τ-Voice-banking, по данным Google;
  • 97,7% – рассуждение по аудиозапросам в Big Bench Audio, по данным Google.

Speech to Speech Quality Index – сводный показатель Artificial Analysis с равным весом речевого рассуждения, выполнения агентных задач, пользовательских предпочтений и успешного завершения заданий. Первое место в этом индексе не означает лидерство модели в каждой отдельной дисциплине.

Базовая Gemini 3.8 Live получила 76 баллов в том же сводном индексе и заняла второе место в Speech Agent Arena, где участники сравнивают ответы двух скрытых моделей. Результаты Extended Thinking получены с высоким уровнем рассуждения, поэтому их нельзя автоматически переносить на базовую модель или другие режимы.

Gemini API: 0,005 $ за минуту входящего аудио

Разработчикам доступны стабильные идентификаторы gemini-3.8-live и gemini-3.8-live-extended-thinking. Обе модели можно использовать через Gemini API и Google AI Studio.

В платном тарифе Gemini API обработка входящего аудио стоит 3 $ за 1 млн токенов, или около 0,005 $ за минуту. Исходящее аудио оценивается в 12 $ за 1 млн токенов, или около 0,018 $ за минуту. Для текста установлена цена 0,75 $ за 1 млн входных и 4,50 $ за 1 млн выходных токенов, включая токены рассуждения.

Тарифная таблица не устанавливает отдельную повышенную ставку для Extended Thinking. Однако сложная задача может обойтись дороже из-за большего количества выходных токенов, потраченных на фоновое рассуждение.

Extended Thinking приходит в Gemini Live, Gmail, Документы и Keep

comss img 2026 09 16 074119
comss img 2026 09 16 074126

Обычные пользователи получают Gemini 3.8 Live в Search Live, а Extended Thinking – в Gemini Live. Распространение выполняется поэтапно, поэтому новая модель может появиться в аккаунтах не одновременно.

На смартфонах голосовой режим доступен через приложение Google Gemini для Android.

Для устройств Apple используется отдельное приложение Google Gemini для iPhone, которое также поддерживает Gemini Live.

В Google Документах Extended Thinking предназначена для подписчиков Google AI Pro и Ultra. В Gmail и Keep модель заявлена для пользователей всех подписок Google AI. Бизнес-клиенты Google Workspace получат её позднее.

Google недавно выпустила отдельное приложение Gemini для Windows, но в новом анонсе компания не приводит отдельный график появления Gemini 3.8 Live для настольных платформ.

Gemini Enterprise предоставляет обе модели в режиме закрытого предварительного тестирования. Поддержка Gemini Enterprise for Customer Experience заявлена на более поздний срок без точной даты.

Аудио получает метку SynthID, а знания ограничены январём 2025 года

Все аудиозаписи, созданные новыми моделями в продуктах Google, получают цифровую метку SynthID. Она встраивается непосредственно в звуковой сигнал, не должна восприниматься на слух и позволяет инструментам Google определить происхождение записи.

SynthID – технология Google DeepMind для маркировки созданных ИИ изображений, аудио, видео и текста. Незаметная для человека цифровая метка встраивается в содержимое при его создании и позднее может быть обнаружена средствами Google.

В карточке Gemini 3.8 Audio указан предел знаний на январь 2025 года. Модели поддерживают поиск Google через API, но могут допускать фактические ошибки, замедляться или завершать запрос по тайм-ауту. Поэтому Extended Thinking подходит для сложных голосовых задач, но её ответы и действия по-прежнему требуют проверки, особенно при работе с актуальными или чувствительными данными.

Автор:
Комментарии и отзывы

Нашли ошибку?

Новое на сайте