Распознавание речи (ASR, automatic speech recognition) – это технология, которая превращает звучащую речь в текст на том же языке. Вы говорите или загружаете запись, а программа возвращает готовые слова. Именно так работает распознавание речи в голосовых помощниках, субтитрах и сервисах расшифровки: звук на входе, текст на выходе, без человека посередине.
Ниже разберём всю цепочку по шагам: как звук превращается в признаки, что делают акустическая и языковая модели, что влияет на точность и как её измеряют метрикой WER. Технология одна, а режима два – мы распознаём и живой поток с микрофона, и загруженный файл.
Что такое распознавание речи (ASR)
Распознавание речи – это автоматический перевод устной речи в письменный текст. Раньше эту работу делал человек, который расшифровывал запись на слух за несколько часов; теперь её выполняет модель за минуты. Смысл остаётся тем же: зафиксировать сказанное в буквах, с которыми потом можно работать.
Чтобы понять, как работает распознавание речи, достаточно проследить путь звука от микрофона до готовой строки текста. По дороге сигнал проходит несколько стадий, и на каждой теряется или сохраняется часть информации, поэтому итоговая точность складывается из качества записи и качества моделей.
Важно не путать распознавание с переводом. ASR не меняет язык: русская речь становится русским текстом. Наш движок понимает около 100 языков, включая русский и языки СНГ, но каждый остаётся при своём. Перевод на другой язык – отдельная задача, и распознавание её не решает.
Как звук превращается в текст: этапы
Коротко, путь такой: звук оцифровывается, из него выделяются признаки, а две модели по этим признакам собирают текст. Микрофон превращает колебания воздуха в цифровой сигнал, обычно с частотой 16 кГц. Дальше сигнал режется на короткие отрезки по 10–25 миллисекунд, и для каждого считается частотный портрет – набор признаков, который описывает, какие звуки в нём звучат.
Дальше работают две нейросети. Акустическая модель сопоставляет признаки со звуками языка (фонемами), а языковая модель выбирает, какая последовательность слов осмысленна: она знает, что «поехали в офис» вероятнее, чем «по ехали в офис». На стыке этих двух моделей и рождается текст, к которому мы добавляем пунктуацию и деление на спикеров.
| Этап | Что происходит | Результат |
|---|---|---|
| Оцифровка | Микрофон пишет звук с частотой ~16 кГц | Цифровой аудиосигнал |
| Признаки | Сигнал делится на отрезки 10–25 мс, считается спектр | Частотные признаки |
| Акустическая модель | Признаки сопоставляются со звуками языка | Вероятные фонемы |
| Языковая модель | Выбор осмысленной последовательности слов | Черновой текст |
| Постобработка | Пунктуация, тайм-коды, спикеры | Готовая расшифровка |
Современные модели часто объединяют эти шаги в одну сеть (end-to-end), которая учится сразу переводить признаки в текст на сотнях тысяч часов речи. Но принцип остаётся тем же: без хорошего звука на входе никакая модель не соберёт точный текст. Поэтому последний этап, постобработку, мы не считаем формальностью: именно здесь черновой поток слов превращается в читаемую расшифровку с пунктуацией и делением на спикеров.
Диаризация на этой стадии размечает, кто говорил, и ставит тайм-код к каждой реплике. За счёт этого в готовом тексте видно структуру разговора, а не сплошную стену слов, и нужный фрагмент часовой записи находится по времени за секунды.

Что влияет на точность: язык, шум и канал
На точность распознавания влияют три вещи: разборчивость речи, фоновый шум и ширина звукового канала, а не формат файла. Модели безразлично, пришёл звук из mp3 или wav; ей важно, слышно ли слова. Чистая запись одного говорящего распознаётся точнее всего, а наложение нескольких голосов и громкий фон добавляют ошибок.
Отдельная история – телефон. Линия сжимает звук до узкого канала 8 кГц и срезает высокие частоты, поэтому часть звуков теряется, и универсальные движки на телефонии проседают. Мы ведём телефонную дорожку отдельной моделью и держим точность около 90% там, где общие модели ошибаются заметно чаще.
| Фактор | Как влияет | Что делать |
|---|---|---|
| Фоновый шум | Перекрывает голос, растит ошибки | Писать ближе к источнику, тише фон |
| Наложение голосов | Реплики сливаются | Диаризация разведёт по спикерам |
| Канал 8 кГц (телефон) | Теряются высокие частоты | Отдельная модель под телефонию (~90%) |
| Тихая или невнятная речь | Пропуски и замены | Проговаривать чётче, ближе к микрофону |
Отсюда простое правило: чем ближе условия к чистой студийной записи, тем ниже ошибка. Диктофон в 20 сантиметрах от говорящего даст заметно лучший результат, чем тот же диктофон в кармане на совещании. Модель одинаково старается на любом входе, но физику канала обойти нельзя, поэтому часть работы над точностью лежит на стороне записи, а не только на стороне ASR.

Как измеряют качество: WER и WAcc
Качество ASR измеряют метрикой WER (Word Error Rate) – это доля ошибочных слов в расшифровке относительно эталона, и меньше здесь лучше. Обратная величина, WAcc, показывает долю правильных слов: WAcc = 100% − WER. По этим двум числам движки и сравнивают между собой.
На бенчмарке из 7 датасетов русской речи у нас WER 7,10% и WAcc 92,9%. Для ориентира приводим соседей по рынку: Whisper-large-v3 показывает WER 7,44%, AssemblyAI – 7,03%, ElevenLabs – 6,88%. Разброс в пределах процента, поэтому на русской речи значение около 7–8% – это сильный уровень, а не потолок ошибок.

Поток и файл: два режима
Распознавание работает в двух режимах, и выбор зависит от задачи. В потоковом режиме звук идёт по WebSocket, и текст печатается прямо во время речи – это диктовка и живые субтитры без ожидания конца записи. В файловом режиме вы загружаете готовую запись целиком и получаете весь текст сразу.
Скорость файлового режима измерима: обработка занимает примерно 1–2% от длительности записи, так что часовой файл превращается в текст за минуту-другую. Оба режима доступны через один speech-to-text API, совместимый с OpenAI: и загрузка файлов, и поток по WebSocket идут по единому контракту.
Как попробовать распознавание речи
Проще всего проверить технологию на своей записи. Загрузите файл или включите микрофон на странице аудио в текст, и движок вернёт текст со спикерами и тайм-кодами. Короткие записи и голосовые примет Telegram-бот @VoicePalatineBot – до 100 транскрибаций в день без регистрации.
Если хочется глубже разобраться в цифрах, посмотрите, от чего зависит точность распознавания речи и как её измеряют. А для интеграции в свой продукт распознавание подключается через API от 0,29 ₽/мин по модели pay-as-you-go, без отдельной подписки.
Частые вопросы
-
Что такое ASR простыми словами? ASR (automatic speech recognition) – это автоматическое распознавание речи, то есть перевод звучащих слов в текст на том же языке. Программа слушает запись или микрофон и печатает то, что услышала, без участия человека.
-
Как компьютер распознаёт речь? Звук оцифровывается, из него выделяются признаки (частотный портрет каждого короткого отрезка), а нейросетевые акустическая и языковая модели по этим признакам подбирают наиболее вероятную последовательность слов. На выходе – связный текст с пунктуацией.
-
Что такое WER и какой считается хорошим? WER (Word Error Rate) – доля ошибочных слов в расшифровке: чем меньше, тем лучше. У Palatine Speech WER 7,10% по бенчмарку на 7 датасетах, у Whisper-large-v3 – 7,44%. Значение около 7–8% на русской речи считается сильным результатом.
-
Почему по телефону распознаётся хуже? Телефонная линия сжимает звук до узкого канала 8 кГц и режет высокие частоты, поэтому часть звуков теряется. Мы обрабатываем телефонную дорожку отдельной моделью под телефонию и держим точность около 90% там, где универсальные движки проседают.
-
Чем потоковое распознавание отличается от файлового? В потоковом режиме текст появляется прямо во время речи по WebSocket – это диктовка в реальном времени. В файловом вы загружаете готовую запись и получаете весь текст сразу; обработка занимает около 1–2% от длительности файла.
-
Сколько языков понимает распознавание речи? Наш движок распознаёт около 100 языков, включая русский и языки СНГ. Язык на выходе тот же, что в записи: русская речь превращается в русский текст, перевод на другой язык – это отдельная задача.
-
Распознаёт ли речь с фоновым шумом? Да, но точность зависит от того, насколько шум перекрывает голос. На результат влияют разборчивость речи, громкость фона и наложение нескольких голосов, а не формат файла. Чистая запись с одним говорящим распознаётся точнее всего.
-
Где попробовать распознавание речи? Загрузите файл или включите микрофон на странице сервиса, а для коротких записей есть Telegram-бот @VoicePalatineBot – до 100 транскрибаций в день. Для интеграции в свой продукт есть OpenAI-совместимый API.