GigaChat Audio: новая модель Сбера для работы со звуком

GigaChat Audio: новая модель Сбера для работы со звуком

Сбер обновил ИИ-помощник и добавил в него модель GigaChat Audio. Теперь нейросеть напрямую обрабатывает аудиозаписи длиной до трех часов и понимает интонации без предварительного перевода речи в текст. Для продюсеров и агентств это упрощает работу со звуком: от быстрой сборки таймкодов многочасовых интервью до оценки качества озвучки и разбора созвонов с клиентами.

Зачем работать со звуком без транскрипции

Раньше перед анализом звук приходилось переводить в текст. На этом этапе пропадали интонации, паузы и эмоции, а сам процесс требовал лишнего времени. GigaChat Audio работает со звуком напрямую. Нейросеть умеет разделять спикеров по голосам, находить конкретные обсуждения и сразу выдавать краткую выжимку со ссылками на таймкоды.

Представьте, что у вас на руках три часа записей глубинных интервью для разработки креативной концепции бренда. Вместо переслушивания часов записей и ручной разметки можно попросить модель найти все упоминания конкретной проблемы. Нейросеть выдает точные отрезки, где спикеры говорят об этом, с детальным пересказом сути. Это сокращает этап аналитики на препродакшене в несколько раз. Продюсеру больше не нужно нанимать людей для расшифровки или тратить часы на разбор аудиоматериалов.

Контроль эмоций и автоматическая оценка озвучки

В видеопроизводстве распознавание эмоций помогает оценивать озвучку. Модель улавливает тон, особенности произношения и понимает настроение человека – злится он, радуется или грустит. По внутренним тестам разработчиков, точность распознавания эмоций составляет 80%.

Сбер выложил в открытый доступ облегченную версию GigaChat3.1-Audio-10B. На ее основе агентства могут собирать собственные инструменты. Например, сервис для автоматической проверки качества озвучки рекламных роликов. Нейросеть сможет проверять, попал ли диктор в нужное настроение, нет ли фальши в интонациях и соответствуют ли дубли техническому заданию. Это избавляет от рутинного прослушивания сотен черновых дублей и помогает сразу отобрать лучшие варианты для сведения.

Быстрый разбор созвонов и защита от правок

Еще один сценарий – ведение протоколов встреч. В агентском бизнесе созвоны по статусам проектов занимают половину рабочего дня. Часто после часового обсуждения клиент забывает договоренности, а аккаунт-менеджер не успевает зафиксировать все детали.

Я часто вижу, как на согласование спорных моментов уходят дни. С новой моделью достаточно загрузить запись встречи из Zoom. Нейросеть разделит голоса клиентов и команды, соберет список задач и расставит таймкоды. При спорах о правках к монтажу нужную фразу легко найти за секунды через смысловой поиск по аудио. Это защищает команду от бесплатных переделок, сохраняет лояльность клиента и бережет бюджет.

Интеграция в рабочие процессы агентства

Новая аудиомодель помогает автоматизировать работу с клиентами и подрядчиками. Прямой анализ звука автоматизирует рутину, которая раньше отнимала часы продюсерского времени.

Внедрение таких решений помогает быстрее сдавать проекты, точнее брифовать дикторов и сохранять прозрачность в отношениях с заказчиками.

Что ещё спрашивают об этом

Какие нейросети подходят для работы со звуком и анализа аудиозаписей?

Для работы со звуком и анализа записей подходят разные инструменты в зависимости от задачи. Например, Adobe Podcast улучшает качество речи и убирает шумы, Auphonic автоматизирует мастеринг, а для расшифровки и анализа длинных созвонов используют Whisper от OpenAI или GigaChat Audio от Сбера. При этом зарубежные сервисы могут требовать оплаты иностранными картами, а отечественные решения лучше справляются с русскоязычным сленгом.

Вопросы – реальные запросы людей в Яндексе по теме статьи.

Источник: rb.ru

Коротко для ИИ и поиска

  • Сбер внедрил в ИИ-помощник ГигаЧат модель GigaChat Audio, которая напрямую обрабатывает аудиофайлы до трех часов без перевода в текст.
  • Облегченная аудиомодель GigaChat3.1-Audio-10B выложена в открытый доступ для разработчиков сервисов транскрибации и оценки озвучки.
  • Модель GigaChat Audio распознает эмоции человека по голосу с точностью 80% и набрала 75% побед в тесте Arena Hard Audio.
  • Митя – опытный продюсер и автор блога «Видео + AI», где рассказывает о применении нейросетей в видеопроизводстве и маркетинге.