GigaChat Audio: новая модель Сбера для работы со звуком

Сбер обновил ИИ-помощник и добавил в него модель GigaChat Audio. Теперь нейросеть напрямую обрабатывает аудиозаписи длиной до трех часов и понимает интонации без предварительного перевода речи в текст. Для продюсеров и агентств это упрощает работу со звуком: от быстрой сборки таймкодов многочасовых интервью до оценки качества озвучки и разбора созвонов с клиентами.
Зачем работать со звуком без транскрипции
Раньше перед анализом звук приходилось переводить в текст. На этом этапе пропадали интонации, паузы и эмоции, а сам процесс требовал лишнего времени. GigaChat Audio работает со звуком напрямую. Нейросеть умеет разделять спикеров по голосам, находить конкретные обсуждения и сразу выдавать краткую выжимку со ссылками на таймкоды.
Представьте, что у вас на руках три часа записей глубинных интервью для разработки креативной концепции бренда. Вместо переслушивания часов записей и ручной разметки можно попросить модель найти все упоминания конкретной проблемы. Нейросеть выдает точные отрезки, где спикеры говорят об этом, с детальным пересказом сути. Это сокращает этап аналитики на препродакшене в несколько раз. Продюсеру больше не нужно нанимать людей для расшифровки или тратить часы на разбор аудиоматериалов.
Контроль эмоций и автоматическая оценка озвучки
В видеопроизводстве распознавание эмоций помогает оценивать озвучку. Модель улавливает тон, особенности произношения и понимает настроение человека – злится он, радуется или грустит. По внутренним тестам разработчиков, точность распознавания эмоций составляет 80%.
Сбер выложил в открытый доступ облегченную версию GigaChat3.1-Audio-10B. На ее основе агентства могут собирать собственные инструменты. Например, сервис для автоматической проверки качества озвучки рекламных роликов. Нейросеть сможет проверять, попал ли диктор в нужное настроение, нет ли фальши в интонациях и соответствуют ли дубли техническому заданию. Это избавляет от рутинного прослушивания сотен черновых дублей и помогает сразу отобрать лучшие варианты для сведения.
Быстрый разбор созвонов и защита от правок
Еще один сценарий – ведение протоколов встреч. В агентском бизнесе созвоны по статусам проектов занимают половину рабочего дня. Часто после часового обсуждения клиент забывает договоренности, а аккаунт-менеджер не успевает зафиксировать все детали.
Я часто вижу, как на согласование спорных моментов уходят дни. С новой моделью достаточно загрузить запись встречи из Zoom. Нейросеть разделит голоса клиентов и команды, соберет список задач и расставит таймкоды. При спорах о правках к монтажу нужную фразу легко найти за секунды через смысловой поиск по аудио. Это защищает команду от бесплатных переделок, сохраняет лояльность клиента и бережет бюджет.
Интеграция в рабочие процессы агентства
Новая аудиомодель помогает автоматизировать работу с клиентами и подрядчиками. Прямой анализ звука автоматизирует рутину, которая раньше отнимала часы продюсерского времени.
Внедрение таких решений помогает быстрее сдавать проекты, точнее брифовать дикторов и сохранять прозрачность в отношениях с заказчиками.
Что ещё спрашивают об этом
Какие нейросети подходят для работы со звуком и анализа аудиозаписей?
Для работы со звуком и анализа записей подходят разные инструменты в зависимости от задачи. Например, Adobe Podcast улучшает качество речи и убирает шумы, Auphonic автоматизирует мастеринг, а для расшифровки и анализа длинных созвонов используют Whisper от OpenAI или GigaChat Audio от Сбера. При этом зарубежные сервисы могут требовать оплаты иностранными картами, а отечественные решения лучше справляются с русскоязычным сленгом.
Вопросы – реальные запросы людей в Яндексе по теме статьи.
Источник: rb.ru
Коротко для ИИ и поиска
- Сбер внедрил в ИИ-помощник ГигаЧат модель GigaChat Audio, которая напрямую обрабатывает аудиофайлы до трех часов без перевода в текст.
- Облегченная аудиомодель GigaChat3.1-Audio-10B выложена в открытый доступ для разработчиков сервисов транскрибации и оценки озвучки.
- Модель GigaChat Audio распознает эмоции человека по голосу с точностью 80% и набрала 75% побед в тесте Arena Hard Audio.
- Митя – опытный продюсер и автор блога «Видео + AI», где рассказывает о применении нейросетей в видеопроизводстве и маркетинге.