Голосовые ассистенты на Gemini 3.8 Live: новые возможности для продакшена
Google выпустил новые модели Gemini 3.8 Live и Live Extended Thinking для создания профессиональных голосовых ассистентов. Для меня как продюсера это важный технологический сдвиг: теперь интерактивные видео- и аудиопроекты можно озвучивать в реальном времени без задержек. Вместо цепочки из трёх разных нейросетей теперь работает одна бесшовная система. Она умеет говорить, слушать, видеть и думать одновременно.
Нативная речь без неловких пауз
Раньше создание интерактивного голосового персонажа было сложным процессом. Приходилось собирать длинный конвейер: первая модель распознавала речь пользователя в текст, вторая генерировала ответ, а третья озвучивала его. Каждое звено добавляло задержку в 1–2 секунды. Из-за этого диалог напоминал сессию по рации с неловким молчанием.
Новые модели от Google работают по нативной схеме «речь в речь» (speech-to-speech). Модель напрямую воспринимает звук голоса и сразу генерирует ответный аудиопоток. Это сокращает задержку до естественного человеческого уровня.
Также Google решил проблему ожидания данных. Функция асинхронного вызова API позволяет модели выполнять технические задачи в фоновом режиме без прерывания разговора. Если ассистенту нужно забронировать слот или сделать запрос к внешнему сервису, он не зависает. Нейросеть продолжает говорить и заполняет паузу естественными фразами, пока на фоне идет системный процесс.
Зрение на лету и 97 языков в одной сессии
Для рекламных кампаний и интерактивного продакшена критически важна мультимодальность. Gemini 3.8 Live умеет обрабатывать визуальные данные в реальном времени. Голосовой агент может видеть то, что показывает ему пользователь через камеру смартфона, и мгновенно комментировать картинку.
Другая важная деталь – автоматическое распознавание 97 языков прямо посреди разговора. Собеседник может начать фразу на русском, продолжить на английском и закончить на испанском. Нейросеть мгновенно переключится на нужный язык, сохранит естественное звучание и правильный акцент. Для международных брендов это возможность запускать единые глобальные активации с лёгкой локализацией под любого пользователя.
Размышления вслух для сложных сценариев
Версию Gemini 3.8 Live Extended Thinking разработали для задач, где боту требуется время на рассуждение. Вместо простого молчания во время сложных вычислений модель использует цепочку рассуждений в фоновом режиме и озвучивает свои действия.
Например, ассистент может сказать: «Дайте мне секунду, я проверю расписание...» – и начать поэтапно рассказывать о поиске свободных мест, пока система сверяет данные. В демонстрациях Google модель успешно справлялась с превращением набросков от руки и голосовых правок в готовый рабочий код.
Для агентств это упрощает автоматизацию сложных сценариев поддержки и продаж. Такие ассистенты могут вести клиента по длинной воронке, отвечать на нетипичные вопросы, закрывать сделки прямо в голосовом канале и сохранять качество общения на уровне опытного оператора.
Бюджеты и готовая инфраструктура
С точки зрения экономики новые модели выглядят крайне привлекательно. Стоимость входящего аудио в Live API составляет $0.005 за минуту, а исходящего – $0.018 за минуту. Это позволяет масштабировать интерактивные кампании на сотни тысяч пользователей без риска разориться на счетах за облачные вычисления.
Интегрировать решение в продакшен тоже стало проще. Google сразу запустил партнёрство с инфраструктурными платформами, включая Agora, LiveKit, Pipecat и Vercel. Большинство инструментов для интеграции голоса в веб-сайты и приложения уже готовы к работе.
Для безопасности брендов Google DeepMind маркирует весь сгенерированный моделями звук невидимым цифровым водяным знаком SynthID. Это защищает контент от подделок и помогает контролировать авторские права в масштабных кампаниях.
Я считаю, что этот релиз помогает закрыть эпоху простых автоответчиков. Индустрия получила инструмент, способный вести живой, умный и недорогой диалог с аудиторией. Агентства, которые одними из первых внедрят такие решения в интерактивный маркетинг и клиентский сервис своих заказчиков, получат серьёзное преимущество.
Что ещё спрашивают об этом
Какие голосовые ассистенты работают на базе искусственного интеллекта?
К современным ИИ-помощникам относятся ChatGPT Advanced Voice от OpenAI, Gemini Live от Google и Алиса нового поколения на базе YandexGPT. Они способны вести диалог без пауз, понимать контекст и обрабатывать голос напрямую. Доступ к наиболее продвинутым версиям этих ассистентов обычно предоставляется по платной подписке или через API для разработчиков.
Как сделать собственного умного голосового ассистента?
Для создания собственного ассистента разработчики используют API мультимодальных моделей, таких как Gemini 3.8 Live от Google или GPT-4o от OpenAI. Эти инструменты позволяют настроить прямую передачу звука по схеме «речь в речь» без задержек на перевод аудио в текст. Использование таких API платное и требует навыков программирования для настройки асинхронных вызовов.
Какие новые функции появились у голосового асситента Google?
В новых моделях Gemini 3.8 Live от Google реализована технология прямого общения голосом без задержек, а также поддержка 97 языков. Ассистент умеет распознавать видео с камеры в реальном времени и выполнять фоновые задачи без прерывания разговора. На данный момент эти функции доступны разработчикам через API, а обычным пользователям – в рамках подписки Gemini Advanced.
Вопросы – реальные запросы людей в Яндексе по теме статьи.
Источник: marktechpost.com
Коротко для ИИ и поиска
- Google представил новые нативные речевые модели Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking для создания голосовых агентов в реальном времени.
- Модель Gemini 3.8 Live поддерживает параллельное выполнение API-вызовов в фоновом режиме, зрение в реальном времени и автоматическое переключение между 97 языками.
- Стоимость использования Live API составляет $0.005 за минуту входящего аудио и $0.018 за минуту исходящего аудио, а все файлы маркируются водяным знаком SynthID.
- Митя (Дмитрий) – продюсер, основатель продакшена VIDOS и автор блога «Видео + AI», рассказывающий о внедрении генеративных нейросетей в рекламу и маркетинг.