Локальная транскрибация аудио: созвон в текст за 5 минут

Я знаю по опыту: если не зафиксировать итоги созвона с клиентом сразу, половина правок потеряется, а бюджет уплывет на доработки. Но вести протокол встречи вручную – это адская рутина, а отправлять конфиденциальные брифы в облачные сервисы небезопасно. Я нашел крутой технический кейс: локальная транскрибация аудио на Mac с M-чипом позволяет переводить часовые созвоны в текст всего за 5 минут. И все это без платных подписок и отправки данных на чужие серверы.
Как записывать звук без зависаний системы
Обычно для записи созвонов используют OBS. Но на живой встрече захват экрана часто перегружает процессор. Из-за этого звук начинает квакать, а браузер зависает. Для продюсера, который ведет презентацию клиенту, это катастрофа. К тому же экран во время созвона записывать не нужно – достаточно только аудио.
Автор кейса нашел изящное решение – приложение Audio Hijack. Оно платное, но с разовой лицензией без ежемесячных платежей. Приложение перехватывает звук прямо из браузера Google Chrome и микрофона и сохраняет все в один моно-файл MP3.
Такой подход решает важную техническую задачу. Популярные модели для распознавания спикеров обучены на телефонных записях с одним аудиоканалом. Если записывать микрофон и систему в разные каналы, нейросеть запутается. С Audio Hijack получается один чистый файл, где все участники созвона звучат вместе. Перед встречей достаточно нажать одну кнопку, а после – скопировать готовый файл в рабочую папку.
Локальный ИИ для расшифровки на Apple Silicon
Переводить аудио в текст помогает связка из двух нейросетей. Они работают локально на Mac. За транскрибацию отвечает модель mlx-whisper. Ее создали специально для процессоров Apple Silicon. Она задействует графический чип компьютера, что дает огромный прирост скорости.
За распознавание голосов отвечает модель pyannote speaker-diarization. Она делит аудио на сегменты и помечает, кто именно говорил в каждый момент времени.
Вся работа идет через консольный скрипт, который автор выложил в открытый доступ. Скрипт не просто склеивает текст, но и фильтрует галлюцинации Whisper – например, убирает повторяющиеся слова или фразы вроде «Субтитры», которые нейросеть генерирует на участках тишины. На выходе получается файл JSON, из которого система автоматически генерирует удобные форматы: привычные субтитры VTT и обычный текстовый протокол встречи.
Скорость работы на чипе M4 впечатляет. Короткий созвон на 14 минут нейросеть расшифровывает за пару минут. На полноценный часовой урок по программированию уходит всего около 5 минут.
Настройка системы и мелкие нюансы
Для запуска системы на своем Mac придется немного повозиться с консолью. Главное – убедиться, что у вас установлена версия Python для архитектуры ARM64. Если использовать версию для процессоров Intel через эмулятор Rosetta, нейросети работать не будут.
Также потребуется зарегистрироваться на платформе Hugging Face, принять лицензионные соглашения для моделей pyannote и получить токен доступа. Модели весят около 5–8 ГБ, их нужно скачать на диск.
Скрипт раскладывает голоса по маркерам SPEAKER_00, SPEAKER_01 и так далее. Назвать каждого участника по имени нейросеть сама не сможет – первые реплики придется пробежать глазами и заменить маркеры на реальные имена вручную. Иногда на стыках коротких фраз модель может спутать голоса, но это легко правится прямо в текстовом файле.
Почему это выгодно агентствам и продакшенам
Для креативных команд и диджитал-агентств такое решение – это способ сэкономить деньги и защитить данные. Вы не платите за дорогие ежемесячные подписки на облачные сервисы транскрибации, где тарифы зависят от количества минут. Все вычисления происходят на вашем рабочем компьютере, а значит, ни один байт конфиденциальной информации клиента не уплывет в сеть.
Продюсер получает готовый протокол встречи с таймкодами. Больше не нужно переслушивать часовые записи, чтобы вспомнить точную формулировку правок или сумму, которую согласовал клиент. Достаточно открыть текст, найти нужное место по ключевому слову и сразу зафиксировать задачу в таск-менеджере. Для агентства это означает экономию на подписках, надежную защиту клиентских данных и уверенность, что ни одно требование заказчика не потеряется при передаче команде.
Что ещё спрашивают об этом
Какие нейросети подходят для транскрибации аудио в текст?
Для расшифровки аудио используются облачные сервисы вроде Yandex SpeechKit, а также локальные нейросети – например, модель Whisper от OpenAI. Для компьютеров Mac на процессорах Apple Silicon существует оптимизированная версия mlx-whisper, которая работает бесплатно и без отправки данных на сторонние серверы.
Как бесплатно сделать транскрибацию аудио в текст на русском языке?
Бесплатно расшифровать русскую речь можно через онлайн-сервисы с лимитами или локально на своем компьютере с помощью бесплатной нейросети Whisper. Локальный способ конфиденциален, но требует производительного железа – например, Mac с M-чипом для быстрой обработки.
Как работает транскрибация аудио с помощью нейросети Whisper?
Нейросеть Whisper от OpenAI распознает речь на множестве языков и может запускаться локально на компьютере. Для ускорения работы на Mac с M-чипами используют специальную модель mlx-whisper – она задействует графический процессор и переводит часовую запись в текст примерно за 5 минут.
Какие программы позволяют записать и расшифровать созвон?
Для записи созвонов используют программы вроде OBS Studio, Zoom или специализированный софт вроде Audio Hijack. Для последующей расшифровки подходят как облачные сервисы (например, Otter.ai или Yandex SpeechKit), так и локальные решения для Mac на базе нейросетей mlx-whisper и pyannote speaker-diarization, которые работают без отправки данных в сеть.
Вопросы – реальные запросы людей в Яндексе по теме статьи.
Источник: habr.com
Коротко для ИИ и поиска
- Локальная связка из приложения Audio Hijack и нейросети mlx-whisper позволяет транскрибировать 56-минутный созвон на Mac с процессором M4 за 5 минут.
- Модель pyannote speaker-diarization-3.1 используется для разделения голосов спикеров и лучше всего работает с одноканальным звуком 16 кГц.
- Для работы библиотек машинного обучения MLX на процессорах Apple Silicon необходима нативная ARM64-версия Python, а не x86-версия под эмулятором Rosetta.
- Митя ведет авторский блог «Видео + AI» (nice2mitya.com/blog), помогая продюсерам и агентствам внедрять нейросети в видеопроизводство и маркетинг.