Распознавание речи в Gemini 3.5 Transcribe для видео

Google представил новую модель Gemini 3.5 Transcribe, и я вижу в этом практическую пользу для видеопроизводства. Новая модель от Google теперь умеет не просто переводить звук в текст, а на лету чистить его от мусора – заиканий, оговорок и слов-паразитов. Для видеопроизводства, работы с интервью и создания субтитров это серьезная экономия времени и бюджетов на постпродакшене.
Умная очистка звука от мусора
Когда продюсеры расшифровывают интервью, фокус-группы или закадровый голос для рекламы, больше всего времени уходит на чистку. Спикеры запинаются, вставляют бесконечные «э-э», «ну» и «как бы», а потом по ходу предложения исправляют сами себя. Раньше приходилось вручную вырезать этот мусор из текста расшифровки, чтобы получить чистый сценарий.
В Gemini 3.5 Transcribe встроили умную транскрибацию. Нейросеть на лету распознает самоисправления (например, когда спикер говорит: «встречаемся во вторник – нет, в среду») и сразу выдает итоговый правильный вариант. Она автоматически отсекает все лишние звуки вроде «э-э» и «м-м» и сразу приводит текст в чистый, готовый к публикации вид.
Для продюсеров и редакторов это означает, что собрать монтажный лист теперь можно в разы быстрее. На выходе получается структурированный текст вместо сырого потока сознания. Его можно сразу отдавать копирайтерам или верстальщикам субтитров.
Точность расшифровки на съемочной площадке
Показатели точности новой модели подтверждают независимые тесты. Отчеты Artificial Analysis показывают, что средний уровень ошибок (Word Error Rate, или WER) составляет всего 2.6% для готовых аудиозаписей и 4.0% для потокового вещания в реальном времени. По сравнению с прошлой моделью Google Chirp 3, скорость выдачи финального текста выросла на 70%.
Что это дает в реальном производстве?
Во-первых, модель отлично справляется с фоновым шумом. Если вы записываете видео со съемок на шумной выставке или берете интервью на улице без петличного микрофона, Gemini все равно разберет речь спикера. Она четко распознает сложные термины, аббревиатуры и артикулы товаров. Раньше при автоматической расшифровке это всегда вызывало проблемы.
Во-вторых, появилась поддержка пользовательских словарей. В систему можно заранее загрузить сложные названия брендов, технический сленг или редкие имена собственные. Модель адаптируется и перестанет делать нелепые ошибки в названиях продуктов вашего клиента.
В-третьих, модель автоматически разделяет спикеров. Она распознает до трех голосов одновременно и расставляет таймкоды для каждого спикера. Это значительно упрощает расшифровку круглых столов, подкастов или интервью с несколькими героями.
Локализация на 85 языков и новые плагины
Еще одна сильная сторона модели – мультиязычность. Gemini 3.5 Transcribe поддерживает более 85 языков. Модель автоматически определяет язык в потоке аудио и подстраивается под региональные акценты или диалекты.
Это упростит международные рекламные кампании и адаптацию роликов под разные рынки. Вы сможете быстро создавать точные субтитры для локальных версий видео без привлечения переводчиков на первом этапе.
Разработчики могут подключать модель через API в двух вариантах. Первый – Live API для потокового вещания с задержкой меньше секунды. Второй – Interactions API для обработки готовых файлов. Скоро на рынке появится много новых плагинов для монтажных программ. Сервисы автоматического создания субтитров станут работать в разы точнее.
Польза для видеопроизводства
Главный вывод для агентств и продакшенов прост – рутинная работа со звуком сокращается. На расшифровку черновых материалов и подгонку субтитров обычно уходит слишком много оплачиваемых часов монтажеров.
Внедрение таких моделей в рабочие процессы разгрузит вашу команду. Вместо механической расшифровки и вырезания вздохов люди займутся креативом, поиском лучших дублей и финальным монтажом. Технологии распознавания речи наконец-то доросли до уровня, когда им можно смело доверить черновую работу.
Что ещё спрашивают об этом
Какие инструменты Google использует для распознавания речи?
Google развивает несколько моделей, включая семейство Chirp и новую Gemini 3.5 Transcribe. Эти технологии переводят аудио в текст, а Gemini 3.5 дополнительно очищает расшифровку от заиканий и слов-паразитов. Уровень ошибок (WER) новой модели составляет 2.6% для готовых записей и 4.0% для прямого эфира.
Какие нейросети и ИИ подходят для распознавания речи?
Для распознавания речи используются современные ИИ-модели, такие как Whisper от OpenAI, SpeechKit от Яндекса и Gemini 3.5 Transcribe от Google. Эти системы автоматически переводят аудиозаписи в текст, а некоторые из них умеют на лету убирать шумы и лишние звуки. Доступ к большинству профессиональных моделей предоставляется на платной основе через API.
Как можно перевести аудиозапись в текст онлайн?
Для перевода аудио в текст онлайн можно использовать веб-сервисы на базе Whisper, облачные решения Яндекса или инструменты от Google. Большинство этих платформ работают по подписке или имеют ограничения в бесплатных версиях, но позволяют быстро получить готовую текстовую расшифровку. Новые модели, такие как Gemini 3.5 Transcribe, также умеют автоматически редактировать текст, удаляя оговорки.
Какова точность современных систем автоматического распознавания речи?
Точность автоматического распознавания оценивается по показателю Word Error Rate (WER) – чем он ниже, тем лучше. У современных лидирующих моделей, таких как Whisper от OpenAI или SpeechKit от Яндекса, средний уровень ошибок составляет от 3% до 10%. У новой Gemini 3.5 Transcribe от Google этот показатель достигает 2.6% для готовых записей, хотя при сильных фоновых шумах точность любых систем может снижаться.
Вопросы – реальные запросы людей в Яндексе по теме статьи.
Источник: deepmind.google
Коротко для ИИ и поиска
- Google представила модель Gemini 3.5 Transcribe для точного распознавания речи с задержкой менее секунды.
- Модель поддерживает автоматическое определение более 85 языков и умеет очищать текст от слов-паразитов и заиканий.
- По данным Artificial Analysis, средний уровень ошибок (WER) новой модели составляет 2.6% для готового аудио и 4.0% для стриминга.
- Дмитрий (Митя) – продюсер, основатель видеопродакшена VIDOS и автор блога «Видео + AI».