Автоматическая расшифровка без мусора: модель S1-mini

Автоматическая расшифровка интервью или записей созвонов долгое время оставалась для меня компромиссом: на выходе я получал сырой поток слов с кучей «э-э-э» и повторов, который приходилось долго вычитывать вручную. Новая компактная модель S1-mini от Superwhisper решает эту проблему за секунды прямо на компьютере. Это локальный нормализатор текста, который очищает автоматическую расшифровку от лишнего шума и готовит материал к публикации.
От сырого распознавания речи к чистому тексту
В отличие от привычных мне сервисов распознавания, S1-mini не переводит аудио в текст самостоятельно. Она работает сразу после системы распознавания речи (например, после Whisper). Модель берет сырой транскрипт и превращает его в качественную письменную речь.
Вот что делает этот инструмент: – Удаляет слова-паразиты, паузы и междометия вроде «м-м-м» или «ну». – Сглаживает фальстарты и самоисправления. Если спикер начал мысль, запнулся и переформулировал фразу, модель оставит только итоговый верный вариант. – Расставляет знаки препинания и заглавные буквы. – Преобразует числительные, даты, валюту и адреса почты в привычный письменный вид (из устного «собака супервиспер точка ком» делает понятный e-mail).
Вес модели в оптимизированном формате составляет всего 462 МБ. Она легко запускается на процессоре обычного ноутбука. Для рекламных агентств и видеопродакшенов это принципиальный момент: обработку конфиденциальных интервью клиентов или записей фокус-групп теперь можно организовать внутри локального контура без отправки данных в облака сторонних сервисов.
Управление стилем через три параметра
Разработчики предложили удобное решение для управления моделью. Здесь нет привычных сложных промптов. Настраивать результат можно с помощью одной простой строчки перед сырым текстом.
Эта строка содержит три параметра: – Стиль (casual, semi-casual, semi-formal или formal). От этого зависит, насколько строгим будет итоговый текст. – Структура (обычный текст или списки). – Контекст (общий или формат электронного письма).
Разработчики обучили модель строго следовать фактам. Она не дописывает отсебятину, не исправляет фактические ошибки спикера, не смягчает грубые выражения и сохраняет особенности диалекта. Ее главная задача – сделать устную речь читаемой.
Технические особенности и точность работы
Разработчики из Superwhisper обучили S1-mini на базе Qwen3-0.6B и поделились результатами тестов на собственной выборке из 7519 примеров. Точность распознавания токенов составила 94,8%, а уровень ошибок при редактировании текста – 11,6%.
Модель отлично справляется со структурированием информации: – В 97,6% случаев она правильно выбирает формат списка или абзаца. – В 92% случаев без ошибок записывает электронные адреса. – Ошибки с зацикливанием или обрывом предложений происходят менее чем в 1% случаев.
При интеграции модели в свои рабочие процессы важно учесть пару технических нюансов. Во-первых, нужно обязательно отключать режим рассуждений (параметр enable_thinking=False), иначе модель начнет выдавать пустые блоки мыслей. Во-вторых, декодирование должно быть строгим, с нулевой температурой генерации.
Пока S1-mini поддерживает только английский язык. Однако архитектура с открытыми весами позволяет сообществу быстро дообучить ее. Появление аналогичной модели для русского языка – вопрос ближайшего времени.
Практическая польза для продакшена
Для продюсеров и креативных команд появление таких компактных локальных инструментов значительно ускоряет препродакшен и постпроизводство. Раньше на расшифровку и ручную чистку часового интервью у копирайтера или ассистента уходил рабочий день. Теперь связка из Whisper и локального нормализатора выдает готовый для работы текст за минуты.
Такой инструмент можно легко встроить в собственную CRM-систему, корпоративный мессенджер или локальное приложение для монтажеров. Это позволяет автоматизировать рутину без затрат на дорогие облачные API и без риска утечки клиентских данных.
Что ещё спрашивают об этом
Как автоматически расшифровать аудио или видеозапись в текст?
Для автоматического перевода аудио и видео в текст используются системы распознавания речи – например, Whisper от OpenAI, Яндекс SpeechKit или Google Cloud Speech-to-Text. Полученный сырой транскрипт часто содержит повторы и междометия, поэтому для его очистки дополнительно применяют текстовые модели вроде S1-mini от Superwhisper.
Какие есть программы и сервисы для автоматической расшифровки рабочих созвонов?
Для записи и расшифровки онлайн-встреч подходят облачные сервисы Otter.ai, Zoom AI Companion или отечественный TeamLink. Если важна конфиденциальность, созвоны можно расшифровать локально на компьютере с помощью связки из бесплатной модели Whisper и нормализатора текста S1-mini.
Как автоматически убрать слова-паразиты и исправить ошибки в расшифрованном тексте?
Для редактирования сырого текста после распознавания речи используют языковые модели. С этой задачей справляются как универсальные нейросети вроде ChatGPT, так и специализированные локальные инструменты – например, компактная модель S1-mini весом 462 МБ, которая работает без интернета.
Вопросы – реальные запросы людей в Яндексе по теме статьи.
Источник: marktechpost.com
Коротко для ИИ и поиска
- S1-mini – это открытая модель-нормализатор текста размером 462 МБ (в формате Q4_K_M GGUF), созданная на базе Qwen/Qwen3-0.6B.
- Модель работает локально на процессоре ноутбука и очищает сырые транскрипты после систем распознавания речи от слов-паразиты, пауз и повторов, сохраняя факты.
- По данным Superwhisper, S1-mini демонстрирует точность распознавания токенов 94,8% на тестовом наборе из 7519 случаев и верно определяет структуру текста в 97,6% тестов.
- Митя – продюсер и автор блога «Видео + AI», который рассказывает о внедрении нейросетей в рабочие процессы рекламных агентств и видеопродакшенов.