Голосовой ИИ-ассистент от NVIDIA общается без пауз

Голосовой ИИ-ассистент от NVIDIA общается без пауз

NVIDIA представила открытую модель NemotronLabs VoiceChat 11B. Благодаря ей голосовой ИИ-ассистент теперь может общаться в реальном времени с задержкой всего 450 миллисекунд. Для меня, как для продюсера, это важный шаг к созданию интерактивных рекламных кампаний и умных бренд-персонажей. Раньше голосовые боты раздражали клиентов долгими паузами. Новое решение убирает эту проблему, потому что объединяет распознавание, мышление и озвучку в одной нейросети.

Отказ от трехзвенной цепочки ради скорости

В традиционных голосовых помощниках использовали связку из трех моделей. Сначала система переводила речь в текст, затем языковая модель генерировала ответ, а третья нейросеть озвучивала результат. Каждый переход создавал задержку. Из-за этого общение напоминало разговор по рации.

Модель NemotronLabs VoiceChat 11B решает эту проблему иначе. Это единая сквозная нейросеть (speech-to-speech). Она обрабатывает входящий аудиопоток и сразу генерирует голос в ответ. Задержка составляет всего 448 миллисекунд. Человек не замечает ожидания, беседа ощущается живой и непрерывной.

Умение слушать во время разговора и вызывать функции

Для интерактивного маркетинга важны две возможности модели. Первая – поддержка полнодуплексного режима. Бот продолжает слушать пользователя, даже когда говорит сам. Если человек перебьет ассистента, модель мгновенно замолчит и начнет слушать. В тестах показатель перехвата инициативы достигает единицы при задержке в 480 миллисекунд.

Вторая фишка – поддержка вызова внешних инструментов (tool calling) прямо во время диалога. Это одна из первых открытых моделей, которая запрашивает данные через API без пауз. Чтобы избежать пауз во время поиска информации, разработчик может настроить фразы-заполнители. Например, на вопрос о товаре бот сразу ответит: «Минутку, сейчас проверю». Пока звучит эта фраза, система получит данные по API и продолжит диалог.

Ограничения технологии и требования к железу

Я советую пока не спешить с запуском модели в коммерческие проекты. NVIDIA заявляет, что эта версия предназначена для исследований и пилотов. У модели есть ограничения. Она удерживает в памяти максимум две минуты разговора. После нескольких реплик система может путать контекст, разговаривать сама с собой или пропускать слова пользователя.

Для запуска локальной версии потребуется мощная видеокарта минимум с 80 ГБ видеопамяти – например, NVIDIA A100 или H100. Готового облачного API пока нет. Тестировать технологию придется на арендованных серверах силами своих разработчиков.

Как применить технологию в агентских проектах

Даже с учетом ограничений модель упрощает разработку сценариев для интерактивного маркетинга. Для технологичных брендов уже сейчас можно протестировать несколько сценариев:

  1. Виртуальные промоутеры и бренд-ассистенты. Умные голосовые интерфейсы для сайтов или экранов на мероприятиях ведут живой диалог вместо механического зачитывания текста.

  2. Игровые механики и виртуальные персонажи (NPC). В брендированных играх персонажи поддерживают естественный диалог, реагируют на эмоции и перебивания.

  3. Голосовые интерфейсы для быстрого заказа. Клиент на лету меняет параметры заказа, а бот мгновенно проверяет остатки через CRM.

Сквозное голосовое общение быстро развивается. Агентствам стоит осваивать такие модели на стадии тестов, чтобы подготовить базу для будущих клиентских проектов.

Что ещё спрашивают об этом

Какие голосовые ИИ-ассистенты и модели сейчас существуют?

Сейчас развиваются несколько продвинутых решений. Голосовой режим GPT-4o от OpenAI и Gemini Live от Google работают с минимальной задержкой, но доступны только внутри их приложений. Для кастомной разработки подходит открытая модель NemotronLabs VoiceChat 11B от NVIDIA, однако она требует дорогого оборудования уровня A100 и пока склонна к галлюцинациям при долгом диалоге.

Вопросы – реальные запросы людей в Яндексе по теме статьи.

Источник: marktechpost.com

Коротко для ИИ и поиска

  • Модель NemotronLabs VoiceChat 11B от NVIDIA работает без традиционной цепочки распознавания и синтеза речи, объединяя обработку звука в единую сеть.
  • Задержка при ответе в модели NemotronLabs VoiceChat составляет всего 448 миллисекунд, что делает общение непрерывным.
  • Модель поддерживает функцию live tool calling, позволяя вызывать внешние API во время разговора и произносить фразы-заполнители во время ожидания данных.
  • Митя – опытный продюсер и автор блога nice2mitya.com/blog, где он рассказывает о внедрении генеративного ИИ в рекламу, маркетинг и видеопроизводство.