До вмісту

Gemini 3.8 Live отримав Extended Thinking: голосовий AI тепер може думати й працювати у фоні

3 хв читання
Gemini 3.8 Live отримав Extended Thinking: голосовий AI тепер може думати й працювати у фоні
Gemini 3.8 Live отримав Extended Thinking: голосовий AI тепер може думати й працювати у фоніФото: Google / illustrative

Google зробив голосового AI помітно ближчим до повноцінного агента: нова Gemini 3.8 Live вміє підтримувати природну розмову, а Extended Thinking — продовжувати складне міркування та роботу з інструментами у фоні.

Gemini 3.8 Live отримав Extended Thinking: голосовий AI тепер може думати й працювати у фоні
Gemini 3.8 Live отримав Extended Thinking: голосовий AI тепер може думати й працювати у фоні Фото/ілюстрація: Google / illustrative.

Що саме випустив Google

Google представив дві нові моделі для живого голосового спілкування. Gemini 3.8 Live орієнтована на масштаб і нижчу вартість, а Gemini 3.8 Live Extended Thinking — на складні багатокрокові завдання. Обидві моделі працюють у форматі speech-to-speech, можуть отримувати візуальний контекст і виконувати виклики інструментів у фоні, не перериваючи розмову з користувачем.

Для розробників це важливо не стільки як ще один чатбот, скільки як нова архітектура голосових агентів. Раніше типовий голосовий асистент складався з окремого розпізнавання мовлення, LLM і синтезу голосу. У Live API Google намагається звести ці етапи в одну модель, щоб зменшити затримку і дати агенту можливість одночасно говорити, міркувати та працювати з зовнішніми сервісами.

Extended Thinking змінює поведінку голосового агента

Найцікавіша частина — Extended Thinking. Google описує її як режим, у якому модель може продовжувати фонове міркування та інструментальні виклики навіть тоді, коли основна голосова відповідь уже завершилася. Для інтерфейсів це означає, що подія завершення одного голосового ходу більше не завжди дорівнює повній зупинці роботи агента.

Практичний приклад — технічна підтримка. Користувач може показати камерою пристрій, пояснити проблему голосом, а модель паралельно перевірить базу знань, виконає API-запити й продовжить вести діалог. Google заявляє підтримку понад 97 мов, точніше розпізнавання кодів і технічних даних, а також асинхронні function calls.

Де це вже можна використовувати

Gemini 3.8 Live і Extended Thinking доступні через Gemini Live API та Google AI Studio. Google також інтегрує Live-моделі у Search, Workspace та власний Gemini. Для бізнесу найбільш очевидні сценарії — кол-центри, продажі, навчання, підтримка, голосові оператори та асистенти, які повинні працювати з CRM або внутрішніми системами в реальному часі.

Google опублікував і орієнтовну ціну для розробників: $0,005 за хвилину аудіовходу та $0,018 за хвилину аудіовиходу. Це не означає, що повний продукт коштуватиме саме стільки — до ціни додаються інші компоненти та інфраструктура, — але показує, що компанія явно націлена не лише на демонстрації, а й на масові production-сценарії.

Що це означає для користувачів і розробників в Україні

Для українських продуктів ключове питання — якість української мови, стабільність tool calling і реальна затримка в наших мережах. Якщо ці три речі працюватимуть на заявленому рівні, голосові агенти можуть стати практичними в e-commerce, банкінгу, сервісних службах та внутрішніх корпоративних системах. Особливо корисною виглядає можливість продовжувати розмову, поки агент у фоні виконує довгу операцію.

Водночас Extended Thinking потребує іншої логіки клієнтських застосунків. Розробнику треба враховувати, що модель може залишатися активною після завершення репліки, коректно показувати статус фонової операції і не запускати дублікати дій. Саме ці деталі визначать, чи стане нова Live-модель робочим інструментом, а не лише ефектною голосовою демонстрацією.

Коротко

Google випустив Gemini 3.8 Live та Extended Thinking для голосових агентів. Розбираємо фонове міркування, tool calling, ціни й практичні сценарії.

  • Що саме випустив Google
  • Extended Thinking змінює поведінку голосового агента
  • Де це вже можна використовувати
Gemini 3.8 Live отримав Extended Thinking: голосовий AI тепер може думати й працювати у фоніGoogle / illustrative

FAQ

Чим Extended Thinking відрізняється від звичайної Live?
Extended Thinking орієнтований на складні багатокрокові задачі та довше фонове міркування.
Де доступні моделі?
Через Gemini Live API та Google AI Studio, а також у низці продуктів Google.
Перевірка фактів

Джерела та перевірка

  1. GoogleIntroducing Gemini 3.8 Live and 3.8 Live Extended Thinking
    Первинне джерелоПеревірено 2026-09-17Відкрити джерело ↗
  2. Google DevelopersBuild real-time voice applications with Gemini 3.8 Live
    Первинне джерелоПеревірено 2026-09-17Відкрити джерело ↗
Далі на RankPoint

Читайте більше

Коментарі0 коментарів

Коментарі

Поки що коментарів немає.Обговорення ведеться окремо для кожної мовної версії матеріалу.