Распознавание речи (ASR) — преобразование аудио в текст нейросетевой моделью. Практическая роль: вход в любые голосовые процессы — от протоколов совещаний до аудиоаналитики колл-центра; качество распознавания ограничивает качество всего, что стоит дальше по пайплайну.
Два подхода: самообучение и энкодер-декодер
Wav2Vec-подход: представления из неразмеченного аудио. Модель учится на тысячах часов записей без расшифровок — предсказывает замаскированные фрагменты звука и строит хорошее представление речи. Разметка нужна в малом объёме на финальном шаге: чтобы модель научилась «читать» эти представления текстом, хватает десятков часов транскрибированного аудио против тысяч при обучении с нуля. Отсюда роль подхода — дешёвое дообучение под редкие языки и домены.
Энкодер-декодер уровня Whisper: готовность из коробки. Такие модели обучаются сразу на огромных слабо размеченных парах «аудио — текст», мультиязычны, сами ставят пунктуацию и выдерживают разное качество записи. Цена — большой размер и слабая специализация: узкие домены без дообучения проседают.
Практический выбор. Готовая большая модель — для типовых задач и быстрого старта; самообучаемые представления — когда домен специфичен, а размечать дорого.
WER и его подвохи
WER — доля искажённых слов. Считается как сумма вставок, удалений и замен, делённая на число слов в эталоне; WER 10% означает примерно одно искажение на десять слов. Метрика одинаково наказывает потерю слова и его переворот.
Главный подвох — нормализация. «Двадцать процентов» против «20%», «точка ру» против «.ru» — формально разные строки, и WER растёт на ровном месте. Перед сравнением моделей фиксируют правила нормализации, иначе бенчмарк бессмыслен.
Ошибки неравнозначны. Потерянное «не», перепутанная цифра суммы или фамилия клиента — катастрофа, хотя вклад в WER тот же, что у безобидной замены союза. Для бизнес-задач метрику дополняют точностью на критичных сущностях: числах, именах, терминах.
Средний WER скрывает разброс. Один показатель на смеси «диктофон + совещания + звонки» бесполезен: у каждой колонки свой WER. Решение принимают замером на собственном проверочном наборе в своих условиях записи.
Что реально влияет на качество
Шум и дистанция до микрофона. Отношение сигнал-шум — главный фактор: одна и та же модель на близкой гарнитуре и на записи с трёх метров в открытом офисе различается в разы. Дальняя зона добавляет реверберацию — отражения в помещении смазывают речь не хуже шума.
Акцент и скорость речи. Обучение на больших выборках сгладило большую часть акцентов, но редкие сочетания языка и сильный акцент дают локальный рост ошибок. Быстрая невнятная речь ухудшает распознавание сильнее, чем акцент сам по себе.
Слэнг, аббревиатуры, термины. Внутренние сокращения и названия продуктов не встречались в обучающих данных — модель транслитерирует их или подставляет частотное похожее слово. Лечится, см. дообучение ниже.
Перекрытие речей. Одновременная речь двух человек — худший сценарий: модели уровня «один спикер за раз» сливают реплики в кашу. Совещания без модерации распознаются заметно хуже структурированных звонков.
Пунктуация, сегментация, диаризация
Пунктуация — часть современных моделей, но не бесплатная. Запятые и точки обычно расставляются верно; кавычки, двоеточия и сложные случаи — неточны. Пунктуация критична, если дальше стоит парсинг: пропущенная запятая меняет структуру предложения и результат извлечения.
Сегментация — нарезка на фразы. Для субтитров, протоколов и анализа нужны границы реплик; современные модели сегментируют по паузам и смыслу одновременно, и это отдельная точка настройки: слишком мелкая нарезка рвёт мысль, крупная ломает синхронизацию с аудио.
Диаризация — кто говорил. Это отдельная задача поверх распознавания: группировка фрагментов аудио по голосам. Ошибки двух типов — склейка двух людей в одного и разведение одного человека на двух «спикеров». Для протоколов с атрибуцией реплик диаризация обязательна, и её качество на реальных записях часто хуже самого распознавания.
Где ASR уместен и дообучение на терминах
Рабочие сценарии. Протоколы встреч и звонков, субтитры и расшифровка медиатеки, аналитика обращений в колл-центре, голосовой ввод в полевых условиях. Общее условие окупаемости: аудио уже существует и его много — распознавание делает архив текстовым и пригодным для поиска и анализа.
Словарь терминов — дешёвый рычаг. У ряда моделей есть механизм подсказки: в контекст подаются вероятные слова домена (названия продуктов, фамилии сотрудников) — и выбор между похожими вариантами смещается в их пользу. Дешевле полного дообучения и часто закрывает проблему аббревиатур.
Полное дообучение — когда подсказок мало. Если домен обширен — медицина, юриспруденция, внутренний жаргон, — модель дообучают на расшифровках домена; десятки часов транскрибированного аудио обычно дают заметный сдвиг. Дорогая часть — разметка; экономят полуавтоматической расшифровкой с ручной выверкой.
Текст — только начало пайплайна. Расшифровка ценна, когда из неё извлекают структуру: сущности, суммы, даты, обязательства — это задачи NER и извлечения данных из документов, и ошибки ASR напрямую становятся ошибками извлечения.
Типичные ошибки
- Сравнение моделей по чужим бенчмаркам. WER сильно зависит от домена и качества записи; выбор делают на своём проверочном наборе с фиксированной нормализацией.
- Запись «как получится». Дальняя гарнитура, открытый офис, дешёвый микрофон убивают качество дешевле, чем плохая модель; канал записи — первое, что чинят.
- Гонка за средним WER. Без разбивки по типам записи и без метрики на критичных сущностях среднее число скрывает именно те ошибки, которые стоят денег.
- Диаризация по умолчанию. К «кто говорил» подходят с ожиданиями от распознавания; качество диаризации ниже, и атрибуцию реплик в протоколах проектируют с ручной выверкой.
- Числа без правил. Если дальше стоят расчёты и интеграции, нормализация чисел, дат и сумм фиксируется явно и покрывается тестами, а не остаётся на усмотрение модели.
Частые вопросы
Какой WER считать приемлемым?
Зависит от задачи: для поиска по записям хватает 15–20%, для протоколов нужно меньше 10%, для извлечения сумм и команд метрика другая — точность на сущностях. Порог задаётся допустимостью ошибки, а не таблицей.
Почему на совещаниях распознавание хуже, чем в записи с диктофона?
Сумма факторов: дальняя зона, реверберация, перекрытие речей, движущиеся говорящие. Каждое условие отдельно снимает проценты качества, вместе — кратные потери.
Можно ли заставить модель понимать внутренние аббревиатуры?
Тремя уровнями: словарь-подсказка в контексте (дёшево), нормализация после распознавания (дёшево, но хрупко), дообучение на доменных расшифровках (надёжно, дорого).
Нужна ли диаризация для протоколов встреч?
Если в протоколе должна быть атрибуция «кто сказал» — да, с ожиданием ручной выверки: автодиаризация на реальных встречах регулярно путает спикеров.
Как считать WER честно?
Зафиксировать нормализацию — числа, регистр, пунктуацию, размечать эталон по единым правилам, считать по типам записи отдельно, и только потом сравнивать модели между собой.
Что даёт дообучение на 10–20 часах домена?
Обычно заметный сдвиг на терминах и именах при сохранении общего уровня; основной вклад — устранение систематических подмен внутренних сокращений частотными словами.
Что почитать по теме
- NER — извлечение сущностей из расшифровок;
- Извлечение данных из документов — следующий этап пайплайна;
- Синтез речи — обратная задача;
- Проверочный набор и бенчмарк — как честно сравнивать модели;
- Можно ли передавать персональные данные в нейросеть — записи разговоров как ПДн.