Устная речь звучит сплошным потоком, без точек и запятых, а в готовой расшифровке они уже стоят. Так работает автоматическая пунктуация: при переводе речи в текст мы восстанавливаем знаки препинания сами, по интонации и паузам говорящего. Отдельно включать это не нужно, и платить сверху за расстановку знаков тоже.
Сразу важная оговорка про формат работы. Мы расставляем знаки препинания из звука, а не из готового текста: сервис слышит речь и превращает её в пунктуированный текст с точностью распознавания WER 7,10%. Вставить набранный абзац без аудио, чтобы «просто добавить запятые», здесь нельзя – это другая задача.
Почему в устной речи нет знаков препинания
Знаки препинания – свойство письменного текста, а не звука. Когда человек говорит, он не произносит «точку» или «запятую»: границы предложений он передаёт интонацией, паузой и понижением голоса. Поэтому сырое распознавание речи без пунктуатора выглядит как один длинный ряд слов, который тяжело читать и невозможно цитировать.
Расшифровка восстанавливает эти границы обратно в графику. Мы анализируем, где говорящий сделал паузу, где закончил мысль, где задал вопрос, и ставим соответствующий знак. Работает это на любой записи со звуком – диктофон, телефон, видео, микрофон в браузере, – потому что опорой служит сама речь, а не формат файла.
Цена ошибки тут выше, чем кажется. От одной запятой смысл фразы меняется на противоположный, а сплошной текст без точек невозможно ни быстро прочитать, ни процитировать в документе. Поэтому расстановка знаков препинания – не косметика поверх распознавания, а часть того, что делает расшифровку пригодной для работы.
Как расшифровка расставляет знаки препинания
Расстановку знаков берёт на себя пунктуатор – отдельный шаг после распознавания слов. Он получает поток слов с их временными метками и решает, где поставить точку, запятую, вопросительный или восклицательный знак, а где разбить текст на предложения и абзацы. В результате из потока «предлагаю перейти к голосованию все за» получается «Предлагаю перейти к голосованию. Все за?».
Сигналы у пунктуатора простые по своей природе. Короткая пауза внутри мысли обычно даёт запятую, законченная интонация с понижением голоса – точку, а вопросительный подъём в конце реплики – знак вопроса. Дальше эти решения проверяются по словам вокруг: одни только паузы дали бы запятые где попало, поэтому модель смотрит и на контекст.
Кроме знаков внутри предложений мы делим текст на смысловые абзацы и раскладываем реплики по говорящим через диаризацию, с тайм-кодами. Обработка идёт быстро, порядка 1–2% от длительности записи, так что часовое совещание превращается в размеченный текст примерно за минуту. Работает пунктуация примерно на 100 языках, включая русский и языки СНГ.

Где автопунктуация ошибается и как это вычитать
Идеальной автопунктуации не бывает, и честнее сразу назвать слабые места. Опора на паузы и интонацию подводит там, где смысл неоднозначен: на омонимах, очень длинных фразах без явных пауз и на границе прямой речи. На чистой студийной записи таких мест единицы, на шумном диктофоне – больше.
Поэтому финальная вычитка остаётся за человеком, и это нормальный порядок работы с любой расшифровкой. Таблица ниже подсказывает, на что смотреть при правке.
| Где чаще ошибка | Почему | Что проверить при вычитке |
|---|---|---|
| Омонимы и вводные слова | Знак зависит от смысла, а не от паузы | Запятые вокруг «однако», «конечно», «значит» |
| Длинная фраза без пауз | Нет сигнала о границе предложения | Не слиплись ли два предложения в одно |
| Прямая речь и цитаты | Кавычки и тире по интонации не слышны | Оформление реплик и цитат вручную |
| Шумная запись | Паузы смазаны фоном | Спорные точки и запятые в шумных фрагментах |

Пунктуация, абзацы и деление на спикеров
Пунктуация в расшифровке работает вместе с разметкой структуры, а не отдельно от неё. Мало расставить запятые: чтобы текст читался, его нужно разбить на абзацы и показать, кто говорит. Мы делаем это в одном проходе – знаки препинания, абзацы и спикеры появляются вместе.
Для диалогов и совещаний это меняет читаемость сильнее, чем сами запятые. Реплика каждого участника идёт отдельным абзацем с тайм-кодом, знаки препинания стоят внутри неё, и по тексту сразу видно вопрос, ответ и реакцию. Такой же размеченный текст лежит в основе расшифровки звонков, где важно разделить оператора и клиента.
На длинных записях разметка экономит больше всего времени. В часовом интервью без абзацев и знаков нужный фрагмент искать бесполезно, а в размеченном тексте вы находите его по одному предложению и сразу видите его границы. Тайм-код рядом с репликой возвращает к нужной секунде аудио, если формулировку надо сверить на слух перед публикацией.
Как получить пунктуированный текст и в каких форматах
Чтобы получить текст со знаками препинания, загрузите запись файлом или наговорите её в микрофон – пунктуация появится в результате сама. Приёма по ссылке у нас нет: ролик с площадки сначала скачивают и загружают файлом. Отдельного режима «вставьте текст, а мы расставим знаки» тоже нет, потому что расстановка идёт из звука.
Готовый текст отдаётся в нескольких форматах, и пунктуация сохраняется в каждом.
| Формат | Что внутри | Когда удобен |
|---|---|---|
| txt | Пунктуированный текст сплошняком | Черновик статьи, заметка |
| json, verbose_json | Текст + тайм-коды и спикеры | Разбор и интеграция по API |
| srt, vtt | Реплики с пунктуацией и временем | Субтитры к видео |
Если нужно перенести распознавание в свой продукт, знаки препинания приходят и через аудио в текст в интерфейсе, и через OpenAI-совместимый API (POST /audio/transcriptions). Как устроено само распознавание под капотом, разбираем в статье как работает распознавание речи.

Сколько стоит и как попробовать
Отдельной платы за расстановку знаков препинания нет – она входит в расшифровку, которая стоит от 0,29 ₽/мин по модели pay-as-you-go. Вы платите только за обработанные минуты, баланс не сгорает, а секунды округляются вниз. Данные обрабатываются в 4 ЦОД уровня Tier III на территории РФ по 152-ФЗ.
Проверить качество пунктуации можно бесплатно на короткой записи. Перешлите аудио или голосовое в Telegram-бот @VoicePalatineBot – он обрабатывает до 100 записей в день без регистрации, и вы сразу увидите, как выглядит текст с восстановленными знаками.
Частые вопросы
-
Ставятся ли знаки препинания автоматически? Да. При расшифровке мы восстанавливаем пунктуацию сами: точки, запятые, вопросительные знаки и деление на абзацы появляются в готовом тексте. Отдельно включать эту функцию не нужно, текст сразу читается как письменный.
-
Можно ли вставить готовый текст, чтобы расставить знаки? Нет. Мы работаем со звуком, а не с текстом: расстановка знаков препинания идёт из речи, по интонации и паузам. Если знаки нужны в уже набранном тексте без аудио, это другая задача, и здесь она не решается.
-
Почему в расшифровке иногда стоит не тот знак? Автопунктуация опирается на паузы и интонацию, поэтому спотыкается на омонимах, очень длинных фразах и границе прямой речи. На чистой записи ошибок мало, но финальную вычитку лучше оставить за человеком.
-
Делит ли расшифровка текст на абзацы и спикеров? Да. Кроме знаков препинания мы разбиваем текст на абзацы по смыслу и раскладываем реплики по говорящим через диаризацию, с тайм-кодами. Сплошную стену текста читать не придётся.
-
Насколько точная расшифровка? Точность распознавания – WER 7,10% и WAcc 92,9% по бенчмарку на 7 датасетах. Чем чище звук и разборчивее речь, тем меньше правок останется после автопунктуации.
-
В каких форматах отдаётся текст с пунктуацией? Доступны txt, json, verbose_json, srt и vtt. В srt и vtt знаки препинания сохраняются внутри реплик субтитров, а в txt и json вы получаете обычный пунктуированный текст.
-
Сколько это стоит? Распознавание с пунктуацией стоит от 0,29 ₽/мин по модели pay-as-you-go: отдельной платы за расстановку знаков нет, она входит в расшифровку.