Точность распознавания речи

Перетащите аудио или видео или нажмите, чтобы выбратьMP3 · WAV · M4A · OGG · MP4 · до 30 минут
Пример результата – так выглядит готовая расшифровка
00:47РусскийСпикеры: 2
00:00Спикер 1

Давай коротко по срокам. Мы успеваем к пятнице или переносим на следующую неделю?

00:07Спикер 2

К пятнице успеваем, если макеты придут завтра. Если позже, то реалистичнее вторник, и это я ещё не закладываю правки после ревью.

00:18Спикер 1

Понял. Тогда я тереблю дизайн сегодня, а ты пока начинаешь с той части, которая от макетов не зависит.

00:25Спикер 2

Договорились. И ещё момент: на прошлой неделе мы забыли записать решение по интеграции, потом полчаса вспоминали. Давай в этот раз зафиксируем сразу.

AI-саммари

Фрагмент рабочего созвона: обсуждают сроки по задаче и договариваются, кто отвечает за следующий шаг.

Точность распознавания речи показывает, насколько верно движок перевёл звучащие слова в текст. Измеряют её метрикой WER (word error rate) – долей ошибочных слов относительно эталона. Наш движок держит WER 7,10% и WAcc 92,9% на бенчмарке из 7 датасетов русской речи, то есть примерно 7 неверных слов на 100.

Цифра важна, но сама по себе мало о чём говорит без условий. На чистой студийной записи точны почти все движки, а на диктофоне из шумного кафе проседает любой. Ниже разберём, что стоит за WER, от чего он зависит и как поднять точность своей расшифровки, не меняя сервис.

Что такое WER и WAcc

WER (word error rate) – это доля слов, которые распознаны с ошибкой: замены, пропуски и лишние вставки делятся на число слов в эталоне. WAcc (word accuracy) – зеркальная метрика, доля верных слов. При WER 7,10% точность WAcc составляет 92,9%: два числа описывают одно и то же с разных сторон.

Важно понимать, что WER считают на размеченных наборах записей, а не на одной фразе. Одна и та же модель на чистой речи покажет 3–4%, а на телефонном разговоре с шумом – 15% и выше. Поэтому корректно сравнивать движки только на одинаковых датасетах, что и делает бенчмарк.

Процент удобно переводить в слова. При WER 7,10% на каждые 100 слов приходится около 7 правок. Часовое интервью – это примерно 8–9 тысяч слов, то есть порядка 500–600 мест, которые стоит бегло сверить. Звучит много, но правка по тайм-кодам занимает минуты, а ручная расшифровка того же часа тянется полдня. Именно поэтому даже WER около 7% на практике экономит время, а не создаёт работу.

От чего зависит точность распознавания

Точность распознавания зависит в первую очередь от качества звука, а не от формата файла. Главные факторы – фоновый шум, эхо, узкий телефонный канал 8 кГц, сильный акцент, редкие термины и перекрывающаяся речь двух говорящих. Разборчивый голос в тишине движок разберёт почти без ошибок, а ту же фразу на фоне музыки – с потерями.

У каждого фактора своя механика. Шум и эхо маскируют тихие согласные вроде «с», «ф» и «ш», и модель достраивает их наугад. Сильный акцент сдвигает произношение звуков, а редкие термины, фамилии и аббревиатуры движок заменяет на частотные слова, похожие по звучанию: «Гречин» легко превращается в «горчица». Тяжелее всего наложение речи – когда двое говорят разом, разделить их поток на лету не может ни один распознаватель, поэтому реплики слипаются, а слова на стыке теряются.

Отдельная история – телефонные записи. Линия сжимает звук до канала 8 кГц и срезает верхние частоты речи, из-за чего универсальные модели теряют точность. Мы распознаём телефонную дорожку отдельной моделью под телефонию и держим около 90% там, где общие движки проседают. Таблица ниже собирает основные факторы и что с ними делать.

ФакторКак влияетЧто делать
Фоновый шум и эхоСъедает окончания и короткие словаЗаписывать в тихом помещении
Телефонный канал 8 кГцСрезает частоты, WER растётМодель под телефонию, петличка
Редкие термины и именаЗаменяются на похожие по звукуПроверять при вычитке по тайм-кодам
Перекрытие речиРеплики сливаютсяПо одному говорящему за раз

Точность распознавания в цифрах: WER, WAcc и точность на телефонном канале 8 кГц

Как измеряют точность распознавания

Точность измеряют на бенчмарке: берут набор записей с готовой эталонной расшифровкой, прогоняют через движок и считают WER по каждому файлу. Мы считаем точность на 7 датасетах русской речи, поэтому цифра 7,10% – это среднее по разным условиям, а не результат на одной удобной записи.

Сравнивать движки имеет смысл только на одинаковых данных. По WER наш результат близок к сильнейшим: ElevenLabs даёт 6,88%, AssemblyAI – 7,03%, Palatine Speech – 7,10%, Whisper-large-v3 – 7,44%. Разница между лидерами в пределах одного процента, поэтому на практике сильнее решает не она, а качество самой записи и распознавание русской речи и терминов.

Точность распознавания: WER движков: Доля ошибочных слов на одинаковых датасетах – меньше значит точнее

Как повысить точность своей записи

Поднять точность распознавания проще всего на этапе записи, а не постобработки. Держите микрофон близко ко рту или используйте петличку: громкий чистый сигнал важнее дорогого оборудования. Выбирайте тихое помещение без эха и следите, чтобы в момент реплики говорил один человек, тогда диаризация и распознавание не путаются.

Второй момент – сам файл. Загружайте исходную запись без повторного пересжатия в низкий битрейт: лишняя перекодировка портит звук и добавляет ошибок. Если исходник – видео, аудио в текст движок извлечёт из дорожки сам, конвертировать заранее не нужно. Эти простые шаги дают больший прирост, чем перебор сервисов.

Из технических деталей помогает частота дискретизации от 16 кГц и запись в один канал на говорящего. Диктофоны и телефоны пишут с запасом по качеству, поэтому специально ничего крутить не нужно, но агрессивное шумоподавление лучше выключить: оно нередко срезает согласные вместе с шумом. И ещё одно правило: не кладите телефон в карман или сумку во время записи, приглушённый звук поднимает WER сильнее любого акцента.

Если запись многоголосая, разведите говорящих по отдельным дорожкам. На созвоне включайте запись у каждого участника локально, а не один общий микрофон на переговорную; на подкасте дайте каждому свою петличку и закрепите её на воротнике ближе к рту. Тогда реплики не перекрываются, диаризация чище делит их по спикерам, а движок не гадает, кто из двоих произнёс слово на стыке. Даже простой шаг – рассадить говорящих подальше друг от друга – заметно снижает наложение речи и добавляет точности.

Как повысить точность своей записи: Запись влияет на точность сильнее, чем выбор движка

Почему стопроцентной точности не бывает

Стопроцентной точности не даёт ни один движок, и это нормально. В любой речи остаются омонимы, редкие фамилии, аббревиатуры и слова, произнесённые на фоне шума, где ошибается и человек-расшифровщик. Поэтому WER 0% – недостижимый идеал, а реальная цель – текст, который быстро вычитывается, а не переписывается заново.

На практике это означает беглую проверку спорных мест, а не ручную расшифровку с нуля. Тайм-коды к репликам показывают, на какой секунде звучит сомнительное слово, так что сверка занимает минуты. А если нужно встроить распознавание в свой продукт с постобработкой, это делается через speech-to-text API с пословными тайм-кодами.

Куда именно смотреть при вычитке, тоже понятно. Ошибки кучкуются вокруг имён собственных, узких терминов, чисел и мест, где говорящие перебивают друг друга. Пробегитесь по ним, а середину чистых реплик можно не перечитывать. Так вы тратите внимание на 500–600 рисковых слов из тысяч, а не вычитываете весь текст подряд. Понять глубже, как модель превращает звук в буквы и почему одни слова даются ей труднее других, помогает разбор про как работает распознавание речи.

Частые вопросы

  1. Что такое WER простыми словами? WER (word error rate) – это доля ошибочных слов в расшифровке относительно эталонного текста. Считаются замены, пропуски и лишние вставки. Чем меньше WER, тем точнее распознавание: WER 7,10% означает примерно 7 ошибок на 100 слов.

  2. Какая точность распознавания у Palatine Speech? По бенчмарку на 7 датасетах русской речи точность составляет WER 7,10% и WAcc 92,9%. Для сравнения, Whisper-large-v3 показывает WER 7,44%, AssemblyAI – 7,03%, ElevenLabs – 6,88%.

  3. От чего зависит точность распознавания речи? Сильнее всего влияют фоновый шум, эхо и узкий телефонный канал 8 кГц, а также акцент, редкие термины и перекрывающаяся речь. Формат файла на точность почти не влияет: важно, насколько разборчиво звучит голос.

  4. Как повысить точность расшифровки? Записывайте близким микрофоном или петличкой в тихом месте и следите, чтобы говорил один человек за раз. Такая запись даёт больший прирост точности, чем смена движка распознавания.

  5. Распознаёт ли сервис термины и акценты? Обычная речь с лёгким акцентом распознаётся штатно. Редкие термины, фамилии и аббревиатуры – зона риска для любого движка, поэтому их стоит проверить при вычитке. Тайм-коды помогают быстро найти спорное место в записи.

  6. Бывает ли стопроцентная точность распознавания? Нет. Даже на чистой записи остаются омонимы, редкие имена и слова на фоне шума, где ошибается и человек. Поэтому итоговый текст всегда стоит бегло вычитать, но это минуты правки, а не часы ручной расшифровки.

  7. Почему на телефонных записях точность ниже? Телефонная линия сжимает звук до канала 8 кГц и срезает часть частот речи. Мы обрабатываем такие записи отдельной моделью под телефонию и держим точность около 90% там, где универсальные движки проседают.

  8. Сколько стоит распознавание речи? В Palatine Speech распознавание стоит от 0,29 ₽/мин по модели pay-as-you-go: вы платите только за обработанные минуты, баланс не сгорает.