Как работает распознавание речи

Перетащите аудио или видео или нажмите, чтобы выбратьMP3 · WAV · M4A · OGG · MP4 · до 30 минут
Пример результата – так выглядит готовая расшифровка
00:47РусскийСпикеры: 2
00:00Спикер 1

Давай коротко по срокам. Мы успеваем к пятнице или переносим на следующую неделю?

00:07Спикер 2

К пятнице успеваем, если макеты придут завтра. Если позже, то реалистичнее вторник, и это я ещё не закладываю правки после ревью.

00:18Спикер 1

Понял. Тогда я тереблю дизайн сегодня, а ты пока начинаешь с той части, которая от макетов не зависит.

00:25Спикер 2

Договорились. И ещё момент: на прошлой неделе мы забыли записать решение по интеграции, потом полчаса вспоминали. Давай в этот раз зафиксируем сразу.

AI-саммари

Фрагмент рабочего созвона: обсуждают сроки по задаче и договариваются, кто отвечает за следующий шаг.

Распознавание речи (ASR, automatic speech recognition) – это технология, которая превращает звучащую речь в текст на том же языке. Вы говорите или загружаете запись, а программа возвращает готовые слова. Именно так работает распознавание речи в голосовых помощниках, субтитрах и сервисах расшифровки: звук на входе, текст на выходе, без человека посередине.

Ниже разберём всю цепочку по шагам: как звук превращается в признаки, что делают акустическая и языковая модели, что влияет на точность и как её измеряют метрикой WER. Технология одна, а режима два – мы распознаём и живой поток с микрофона, и загруженный файл.

Что такое распознавание речи (ASR)

Распознавание речи – это автоматический перевод устной речи в письменный текст. Раньше эту работу делал человек, который расшифровывал запись на слух за несколько часов; теперь её выполняет модель за минуты. Смысл остаётся тем же: зафиксировать сказанное в буквах, с которыми потом можно работать.

Чтобы понять, как работает распознавание речи, достаточно проследить путь звука от микрофона до готовой строки текста. По дороге сигнал проходит несколько стадий, и на каждой теряется или сохраняется часть информации, поэтому итоговая точность складывается из качества записи и качества моделей.

Важно не путать распознавание с переводом. ASR не меняет язык: русская речь становится русским текстом. Наш движок понимает около 100 языков, включая русский и языки СНГ, но каждый остаётся при своём. Перевод на другой язык – отдельная задача, и распознавание её не решает.

Как звук превращается в текст: этапы

Коротко, путь такой: звук оцифровывается, из него выделяются признаки, а две модели по этим признакам собирают текст. Микрофон превращает колебания воздуха в цифровой сигнал, обычно с частотой 16 кГц. Дальше сигнал режется на короткие отрезки по 10–25 миллисекунд, и для каждого считается частотный портрет – набор признаков, который описывает, какие звуки в нём звучат.

Дальше работают две нейросети. Акустическая модель сопоставляет признаки со звуками языка (фонемами), а языковая модель выбирает, какая последовательность слов осмысленна: она знает, что «поехали в офис» вероятнее, чем «по ехали в офис». На стыке этих двух моделей и рождается текст, к которому мы добавляем пунктуацию и деление на спикеров.

ЭтапЧто происходитРезультат
ОцифровкаМикрофон пишет звук с частотой ~16 кГцЦифровой аудиосигнал
ПризнакиСигнал делится на отрезки 10–25 мс, считается спектрЧастотные признаки
Акустическая модельПризнаки сопоставляются со звуками языкаВероятные фонемы
Языковая модельВыбор осмысленной последовательности словЧерновой текст
ПостобработкаПунктуация, тайм-коды, спикерыГотовая расшифровка

Современные модели часто объединяют эти шаги в одну сеть (end-to-end), которая учится сразу переводить признаки в текст на сотнях тысяч часов речи. Но принцип остаётся тем же: без хорошего звука на входе никакая модель не соберёт точный текст. Поэтому последний этап, постобработку, мы не считаем формальностью: именно здесь черновой поток слов превращается в читаемую расшифровку с пунктуацией и делением на спикеров.

Диаризация на этой стадии размечает, кто говорил, и ставит тайм-код к каждой реплике. За счёт этого в готовом тексте видно структуру разговора, а не сплошную стену слов, и нужный фрагмент часовой записи находится по времени за секунды.

Как звук превращается в текст: Путь сигнала от микрофона до готовой расшифровки

Что влияет на точность: язык, шум и канал

На точность распознавания влияют три вещи: разборчивость речи, фоновый шум и ширина звукового канала, а не формат файла. Модели безразлично, пришёл звук из mp3 или wav; ей важно, слышно ли слова. Чистая запись одного говорящего распознаётся точнее всего, а наложение нескольких голосов и громкий фон добавляют ошибок.

Отдельная история – телефон. Линия сжимает звук до узкого канала 8 кГц и срезает высокие частоты, поэтому часть звуков теряется, и универсальные движки на телефонии проседают. Мы ведём телефонную дорожку отдельной моделью и держим точность около 90% там, где общие модели ошибаются заметно чаще.

ФакторКак влияетЧто делать
Фоновый шумПерекрывает голос, растит ошибкиПисать ближе к источнику, тише фон
Наложение голосовРеплики сливаютсяДиаризация разведёт по спикерам
Канал 8 кГц (телефон)Теряются высокие частотыОтдельная модель под телефонию (~90%)
Тихая или невнятная речьПропуски и заменыПроговаривать чётче, ближе к микрофону

Отсюда простое правило: чем ближе условия к чистой студийной записи, тем ниже ошибка. Диктофон в 20 сантиметрах от говорящего даст заметно лучший результат, чем тот же диктофон в кармане на совещании. Модель одинаково старается на любом входе, но физику канала обойти нельзя, поэтому часть работы над точностью лежит на стороне записи, а не только на стороне ASR.

Что влияет на точность распознавания: Разборчивость речи, шум и ширина канала, а не формат файла

Как измеряют качество: WER и WAcc

Качество ASR измеряют метрикой WER (Word Error Rate) – это доля ошибочных слов в расшифровке относительно эталона, и меньше здесь лучше. Обратная величина, WAcc, показывает долю правильных слов: WAcc = 100% − WER. По этим двум числам движки и сравнивают между собой.

На бенчмарке из 7 датасетов русской речи у нас WER 7,10% и WAcc 92,9%. Для ориентира приводим соседей по рынку: Whisper-large-v3 показывает WER 7,44%, AssemblyAI – 7,03%, ElevenLabs – 6,88%. Разброс в пределах процента, поэтому на русской речи значение около 7–8% – это сильный уровень, а не потолок ошибок.

Точность распознавания русской речи: WER – доля ошибочных слов, меньше значит лучше

Поток и файл: два режима

Распознавание работает в двух режимах, и выбор зависит от задачи. В потоковом режиме звук идёт по WebSocket, и текст печатается прямо во время речи – это диктовка и живые субтитры без ожидания конца записи. В файловом режиме вы загружаете готовую запись целиком и получаете весь текст сразу.

Скорость файлового режима измерима: обработка занимает примерно 1–2% от длительности записи, так что часовой файл превращается в текст за минуту-другую. Оба режима доступны через один speech-to-text API, совместимый с OpenAI: и загрузка файлов, и поток по WebSocket идут по единому контракту.

Как попробовать распознавание речи

Проще всего проверить технологию на своей записи. Загрузите файл или включите микрофон на странице аудио в текст, и движок вернёт текст со спикерами и тайм-кодами. Короткие записи и голосовые примет Telegram-бот @VoicePalatineBot – до 100 транскрибаций в день без регистрации.

Если хочется глубже разобраться в цифрах, посмотрите, от чего зависит точность распознавания речи и как её измеряют. А для интеграции в свой продукт распознавание подключается через API от 0,29 ₽/мин по модели pay-as-you-go, без отдельной подписки.

Частые вопросы

  1. Что такое ASR простыми словами? ASR (automatic speech recognition) – это автоматическое распознавание речи, то есть перевод звучащих слов в текст на том же языке. Программа слушает запись или микрофон и печатает то, что услышала, без участия человека.

  2. Как компьютер распознаёт речь? Звук оцифровывается, из него выделяются признаки (частотный портрет каждого короткого отрезка), а нейросетевые акустическая и языковая модели по этим признакам подбирают наиболее вероятную последовательность слов. На выходе – связный текст с пунктуацией.

  3. Что такое WER и какой считается хорошим? WER (Word Error Rate) – доля ошибочных слов в расшифровке: чем меньше, тем лучше. У Palatine Speech WER 7,10% по бенчмарку на 7 датасетах, у Whisper-large-v3 – 7,44%. Значение около 7–8% на русской речи считается сильным результатом.

  4. Почему по телефону распознаётся хуже? Телефонная линия сжимает звук до узкого канала 8 кГц и режет высокие частоты, поэтому часть звуков теряется. Мы обрабатываем телефонную дорожку отдельной моделью под телефонию и держим точность около 90% там, где универсальные движки проседают.

  5. Чем потоковое распознавание отличается от файлового? В потоковом режиме текст появляется прямо во время речи по WebSocket – это диктовка в реальном времени. В файловом вы загружаете готовую запись и получаете весь текст сразу; обработка занимает около 1–2% от длительности файла.

  6. Сколько языков понимает распознавание речи? Наш движок распознаёт около 100 языков, включая русский и языки СНГ. Язык на выходе тот же, что в записи: русская речь превращается в русский текст, перевод на другой язык – это отдельная задача.

  7. Распознаёт ли речь с фоновым шумом? Да, но точность зависит от того, насколько шум перекрывает голос. На результат влияют разборчивость речи, громкость фона и наложение нескольких голосов, а не формат файла. Чистая запись с одним говорящим распознаётся точнее всего.

  8. Где попробовать распознавание речи? Загрузите файл или включите микрофон на странице сервиса, а для коротких записей есть Telegram-бот @VoicePalatineBot – до 100 транскрибаций в день. Для интеграции в свой продукт есть OpenAI-совместимый API.