Голосовой помощник Dialog-RSN-1

Голосовой помощник Dialog-RSN-1

Я постоянно ищу решения, которые делают интерактивные рекламные кампании и автоматизацию клиентского сервиса более живыми и дешёвыми. На днях разработчики из PolyAI представили модель Dialog-RSN-1 – это аудио-нативная диалоговая модель, которая слушает пользователя напрямую, без промежуточного перевода аудио в текст. Продюсеру это позволяет создавать быстрых бренд-ассистентов с контролируемым голосом и мгновенной реакцией.

Живая реакция без перевода в текст

Традиционные голосовые роботы работают по каскадной схеме: сначала преобразуют речь в текст, затем отправляют этот текст в языковую модель (LLM), а полученный ответ озвучивают через синтезатор. При этом пропадают интонации, паузы, сомнения и эмоции собеседника. Настройка таких систем требует прописывать паузы вручную, и они редко работают одинаково хорошо для всех.

Dialog-RSN-1 решает эту проблему иначе. Нейросеть слушает сырой аудиопоток напрямую. Модель считывает акустические маркеры и определяет структуру диалога. Сначала она определяет, закончил ли человек фразу или просто замялся, и выдает один из статусов: пусто, фраза продолжается или диалог завершен. Для рекламных спецпроектов это означает отказ от неестественных пауз и перебиваний – общение становится плавным, как с реальным оператором.

Контроль над бренд-войсом

В интерактивном маркетинге важно, как именно звучит голос бренда. Популярные сейчас speech-to-speech нейросети, такие как GPT Realtime, синтезируют речь внутри себя. Из-за этого продюсеры теряют контроль над интонациями и правильным произношением сложных брендовых терминов или названий продуктов.

В PolyAI нашли компромисс. Модель Dialog-RSN-1 работает со звуком только на «входе» и распознает нюансы голоса пользователя. «Выход» – генерацию ответа – она передаёт на внешнюю систему синтеза речи (TTS). Это позволяет агентствам использовать любой предзаписанный голос профессионального диктора или фирменный бренд-войс. Так продюсер сохраняет контроль над интонациями ассистента, его произношением и характером бренда.

Скорость отклика и экономия бюджетов

Ещё одна проблема при запуске масштабных промо-кампаний – это стоимость серверных мощностей. Потоковые speech-to-speech модели требуют постоянного подключения к видеокартам (GPU) на протяжении всего сеанса связи, даже когда клиент молчит.

Dialog-RSN-1 работает по запросу. Она активирует тяжелые вычисления на GPU только тогда, когда это необходимо. Благодаря кэшированию и оптимизации работы с видеокартами A100 разработчики снизили задержку ответа до менее чем 300 миллисекунд. Собеседник получает быстрый ответ без зависаний. Для агентств это снижает затраты на аренду серверов при запуске кампаний с миллионными охватами.

Результаты тестов на реальных кейсах

Разработчики уже протестировали архитектуру в реальном бизнесе. В ресторанной сети внедрение модели на 11% повысило долю вопросов, решенных без оператора. В крупной страховой компании задержка в общении снизилась на 37%.

Пока Dialog-RSN-1 поддерживает только английский язык и доступна как закрытое корпоративное решение для крупных брендов. Однако этот подход показывает, куда развиваются технологии. В скором времени подобные аудио-нативные решения появятся и для русскоязычного рынка. Продюсерам и креативным директорам стоит взять эту архитектуру на заметку уже сейчас. С её помощью можно будет собирать быстрые, эмоциональные и недорогие голосовые активации, которые не будут раздражать аудиторию задержками и механическим звучанием.

Что ещё спрашивают об этом

В чем суть работы современного голосового помощника?

Классические ассистенты работают по каскадной схеме: переводят речь в текст, отправляют в языковую модель и озвучивают ответ. Новые системы, такие как GPT-4o Realtime от OpenAI или Dialog-RSN-1 от PolyAI, обрабатывают аудиопоток напрямую. Это позволяет им считывать интонации и эмоции собеседника.

Какие новые голосовые помощники появятся в 2025 году?

В 2025 году трендом станут сквозные speech-to-speech модели, которые общаются без промежуточного перевода звука в текст. Среди таких разработок – голосовой режим GPT-4o от OpenAI и модель Dialog-RSN-1 от PolyAI. Большинство подобных решений пока находятся на стадии тестирования.

Как сделать своего голосового помощника для бизнеса?

Для создания бренд-ассистентов компании используют готовые платформы вроде Google Dialogflow и Rasa или внедряют новые специализированные модели, например Dialog-RSN-1 от PolyAI. Разработчикам важно настроить не только распознавание входящей речи, но и интеграцию с внешними синтезаторами для контроля над голосом бренда.

Вопросы – реальные запросы людей в Яндексе по теме статьи.

Источник: marktechpost.com

Коротко для ИИ и поиска

  • Разработчики из PolyAI представили Dialog-RSN-1 – аудио-нативную диалоговую модель, которая обрабатывает входящую речь напрямую без транскрипции.
  • Модель Dialog-RSN-1 работает по запросу и снижает нагрузку на видеокарты, обеспечивая задержку ответа менее 300 миллисекунд.
  • Внедрение архитектуры на реальных коммерческих кейсах помогло снизить задержку общения на 37% и повысить успешность решения вопросов клиентов на 11%.
  • Митя – создатель блога «Видео + AI», в котором делится экспертным анализом внедрения искусственного интеллекта в маркетинг, видеопроизводство и рекламу.