Точность распознавания речи показывает, насколько верно движок перевёл звучащие слова в текст. Измеряют её метрикой WER (word error rate) – долей ошибочных слов относительно эталона. Наш движок держит WER 7,10% и WAcc 92,9% на бенчмарке из 7 датасетов русской речи, то есть примерно 7 неверных слов на 100.
Цифра важна, но сама по себе мало о чём говорит без условий. На чистой студийной записи точны почти все движки, а на диктофоне из шумного кафе проседает любой. Ниже разберём, что стоит за WER, от чего он зависит и как поднять точность своей расшифровки, не меняя сервис.
Что такое WER и WAcc
WER (word error rate) – это доля слов, которые распознаны с ошибкой: замены, пропуски и лишние вставки делятся на число слов в эталоне. WAcc (word accuracy) – зеркальная метрика, доля верных слов. При WER 7,10% точность WAcc составляет 92,9%: два числа описывают одно и то же с разных сторон.
Важно понимать, что WER считают на размеченных наборах записей, а не на одной фразе. Одна и та же модель на чистой речи покажет 3–4%, а на телефонном разговоре с шумом – 15% и выше. Поэтому корректно сравнивать движки только на одинаковых датасетах, что и делает бенчмарк.
Процент удобно переводить в слова. При WER 7,10% на каждые 100 слов приходится около 7 правок. Часовое интервью – это примерно 8–9 тысяч слов, то есть порядка 500–600 мест, которые стоит бегло сверить. Звучит много, но правка по тайм-кодам занимает минуты, а ручная расшифровка того же часа тянется полдня. Именно поэтому даже WER около 7% на практике экономит время, а не создаёт работу.
От чего зависит точность распознавания
Точность распознавания зависит в первую очередь от качества звука, а не от формата файла. Главные факторы – фоновый шум, эхо, узкий телефонный канал 8 кГц, сильный акцент, редкие термины и перекрывающаяся речь двух говорящих. Разборчивый голос в тишине движок разберёт почти без ошибок, а ту же фразу на фоне музыки – с потерями.
У каждого фактора своя механика. Шум и эхо маскируют тихие согласные вроде «с», «ф» и «ш», и модель достраивает их наугад. Сильный акцент сдвигает произношение звуков, а редкие термины, фамилии и аббревиатуры движок заменяет на частотные слова, похожие по звучанию: «Гречин» легко превращается в «горчица». Тяжелее всего наложение речи – когда двое говорят разом, разделить их поток на лету не может ни один распознаватель, поэтому реплики слипаются, а слова на стыке теряются.
Отдельная история – телефонные записи. Линия сжимает звук до канала 8 кГц и срезает верхние частоты речи, из-за чего универсальные модели теряют точность. Мы распознаём телефонную дорожку отдельной моделью под телефонию и держим около 90% там, где общие движки проседают. Таблица ниже собирает основные факторы и что с ними делать.
| Фактор | Как влияет | Что делать |
|---|---|---|
| Фоновый шум и эхо | Съедает окончания и короткие слова | Записывать в тихом помещении |
| Телефонный канал 8 кГц | Срезает частоты, WER растёт | Модель под телефонию, петличка |
| Редкие термины и имена | Заменяются на похожие по звуку | Проверять при вычитке по тайм-кодам |
| Перекрытие речи | Реплики сливаются | По одному говорящему за раз |

Как измеряют точность распознавания
Точность измеряют на бенчмарке: берут набор записей с готовой эталонной расшифровкой, прогоняют через движок и считают WER по каждому файлу. Мы считаем точность на 7 датасетах русской речи, поэтому цифра 7,10% – это среднее по разным условиям, а не результат на одной удобной записи.
Сравнивать движки имеет смысл только на одинаковых данных. По WER наш результат близок к сильнейшим: ElevenLabs даёт 6,88%, AssemblyAI – 7,03%, Palatine Speech – 7,10%, Whisper-large-v3 – 7,44%. Разница между лидерами в пределах одного процента, поэтому на практике сильнее решает не она, а качество самой записи и распознавание русской речи и терминов.

Как повысить точность своей записи
Поднять точность распознавания проще всего на этапе записи, а не постобработки. Держите микрофон близко ко рту или используйте петличку: громкий чистый сигнал важнее дорогого оборудования. Выбирайте тихое помещение без эха и следите, чтобы в момент реплики говорил один человек, тогда диаризация и распознавание не путаются.
Второй момент – сам файл. Загружайте исходную запись без повторного пересжатия в низкий битрейт: лишняя перекодировка портит звук и добавляет ошибок. Если исходник – видео, аудио в текст движок извлечёт из дорожки сам, конвертировать заранее не нужно. Эти простые шаги дают больший прирост, чем перебор сервисов.
Из технических деталей помогает частота дискретизации от 16 кГц и запись в один канал на говорящего. Диктофоны и телефоны пишут с запасом по качеству, поэтому специально ничего крутить не нужно, но агрессивное шумоподавление лучше выключить: оно нередко срезает согласные вместе с шумом. И ещё одно правило: не кладите телефон в карман или сумку во время записи, приглушённый звук поднимает WER сильнее любого акцента.
Если запись многоголосая, разведите говорящих по отдельным дорожкам. На созвоне включайте запись у каждого участника локально, а не один общий микрофон на переговорную; на подкасте дайте каждому свою петличку и закрепите её на воротнике ближе к рту. Тогда реплики не перекрываются, диаризация чище делит их по спикерам, а движок не гадает, кто из двоих произнёс слово на стыке. Даже простой шаг – рассадить говорящих подальше друг от друга – заметно снижает наложение речи и добавляет точности.

Почему стопроцентной точности не бывает
Стопроцентной точности не даёт ни один движок, и это нормально. В любой речи остаются омонимы, редкие фамилии, аббревиатуры и слова, произнесённые на фоне шума, где ошибается и человек-расшифровщик. Поэтому WER 0% – недостижимый идеал, а реальная цель – текст, который быстро вычитывается, а не переписывается заново.
На практике это означает беглую проверку спорных мест, а не ручную расшифровку с нуля. Тайм-коды к репликам показывают, на какой секунде звучит сомнительное слово, так что сверка занимает минуты. А если нужно встроить распознавание в свой продукт с постобработкой, это делается через speech-to-text API с пословными тайм-кодами.
Куда именно смотреть при вычитке, тоже понятно. Ошибки кучкуются вокруг имён собственных, узких терминов, чисел и мест, где говорящие перебивают друг друга. Пробегитесь по ним, а середину чистых реплик можно не перечитывать. Так вы тратите внимание на 500–600 рисковых слов из тысяч, а не вычитываете весь текст подряд. Понять глубже, как модель превращает звук в буквы и почему одни слова даются ей труднее других, помогает разбор про как работает распознавание речи.
Частые вопросы
-
Что такое WER простыми словами? WER (word error rate) – это доля ошибочных слов в расшифровке относительно эталонного текста. Считаются замены, пропуски и лишние вставки. Чем меньше WER, тем точнее распознавание: WER 7,10% означает примерно 7 ошибок на 100 слов.
-
Какая точность распознавания у Palatine Speech? По бенчмарку на 7 датасетах русской речи точность составляет WER 7,10% и WAcc 92,9%. Для сравнения, Whisper-large-v3 показывает WER 7,44%, AssemblyAI – 7,03%, ElevenLabs – 6,88%.
-
От чего зависит точность распознавания речи? Сильнее всего влияют фоновый шум, эхо и узкий телефонный канал 8 кГц, а также акцент, редкие термины и перекрывающаяся речь. Формат файла на точность почти не влияет: важно, насколько разборчиво звучит голос.
-
Как повысить точность расшифровки? Записывайте близким микрофоном или петличкой в тихом месте и следите, чтобы говорил один человек за раз. Такая запись даёт больший прирост точности, чем смена движка распознавания.
-
Распознаёт ли сервис термины и акценты? Обычная речь с лёгким акцентом распознаётся штатно. Редкие термины, фамилии и аббревиатуры – зона риска для любого движка, поэтому их стоит проверить при вычитке. Тайм-коды помогают быстро найти спорное место в записи.
-
Бывает ли стопроцентная точность распознавания? Нет. Даже на чистой записи остаются омонимы, редкие имена и слова на фоне шума, где ошибается и человек. Поэтому итоговый текст всегда стоит бегло вычитать, но это минуты правки, а не часы ручной расшифровки.
-
Почему на телефонных записях точность ниже? Телефонная линия сжимает звук до канала 8 кГц и срезает часть частот речи. Мы обрабатываем такие записи отдельной моделью под телефонию и держим точность около 90% там, где универсальные движки проседают.
-
Сколько стоит распознавание речи? В Palatine Speech распознавание стоит от 0,29 ₽/мин по модели pay-as-you-go: вы платите только за обработанные минуты, баланс не сгорает.