В материале
5 разд.Google сделал голосовой AI заметно ближе к полноценному агенту: новая Gemini 3.8 Live поддерживает естественный разговор, а Extended Thinking продолжает сложное рассуждение и работу с инструментами в фоне.

Что именно выпустил Google
Google представил две новые модели для живого голосового общения. Gemini 3.8 Live рассчитана на масштаб и более низкую стоимость, а Gemini 3.8 Live Extended Thinking — на сложные многошаговые задачи. Обе модели работают в формате speech-to-speech, могут получать визуальный контекст и выполнять вызовы инструментов в фоне, не прерывая разговор с пользователем.
Для разработчиков это важно не столько как очередной чат-бот, сколько как новая архитектура голосовых агентов. Раньше типичный голосовой ассистент состоял из отдельного распознавания речи, LLM и синтеза голоса. В Live API Google пытается объединить эти этапы в одной модели, чтобы снизить задержку и позволить агенту одновременно говорить, рассуждать и работать с внешними сервисами.
Extended Thinking меняет поведение голосового агента
Самая интересная часть — Extended Thinking. Google описывает ее как режим, в котором модель может продолжать фоновое рассуждение и вызовы инструментов даже после завершения основной голосовой реплики. Для интерфейсов это означает, что событие окончания одного голосового хода больше не всегда равно полной остановке работы агента.
Практический пример — техническая поддержка. Пользователь может показать устройство камерой и описать проблему голосом, а модель параллельно проверит базу знаний, выполнит API-запросы и продолжит диалог. Google заявляет поддержку более 97 языков, более точную работу с кодами и техническими данными, а также асинхронные function calls.
Где это уже можно использовать
Gemini 3.8 Live и Extended Thinking доступны через Gemini Live API и Google AI Studio. Google также внедряет Live-модели в Search, Workspace и собственный Gemini. Для бизнеса очевидные сценарии — колл-центры, продажи, обучение, поддержка и голосовые операторы, которым нужно работать с CRM или внутренними системами в реальном времени.
Google опубликовал и ориентировочную цену для разработчиков: $0,005 за минуту аудиовхода и $0,018 за минуту аудиовыхода. Полный продукт, конечно, включает и другие расходы, но эти цифры показывают, что компания нацеливается не только на демо, а на массовые production-сценарии.
Что это значит для Украины
Для украинских продуктов ключевые вопросы — качество украинской речи, стабильность tool calling и реальная задержка в локальных сетях. Если эти три вещи окажутся на заявленном уровне, голосовые агенты смогут стать практичными в e-commerce, банкинге, сервисных службах и корпоративных системах. Особенно полезна возможность продолжать разговор, пока агент в фоне выполняет длинную операцию.
При этом Extended Thinking требует другой логики клиентских приложений. Разработчику нужно учитывать, что модель может оставаться активной после завершения реплики, корректно показывать статус фоновой операции и не запускать дублирующие действия. Именно эти детали определят, станет ли новая Live-модель рабочим инструментом, а не только эффектной голосовой демонстрацией.
Google выпустил Gemini 3.8 Live и Extended Thinking для голосовых агентов. Разбираем фоновое рассуждение, tool calling, цены и сценарии.
- Что именно выпустил Google
- Extended Thinking меняет поведение голосового агента
- Где это уже можно использовать
FAQ
Чем Extended Thinking отличается от обычной Live?
Где доступны модели?
Источники и проверка
- GoogleIntroducing Gemini 3.8 Live and 3.8 Live Extended Thinking
- Google DevelopersBuild real-time voice applications with Gemini 3.8 Live



Комментарии0 комментариев
Комментарии