Расстановка знаков препинания в расшифровке

Перетащите аудио или видео или нажмите, чтобы выбратьMP3 · WAV · M4A · OGG · MP4 · до 30 минут
Пример результата – так выглядит готовая расшифровка
00:47РусскийСпикеры: 2
00:00Спикер 1

Давай коротко по срокам. Мы успеваем к пятнице или переносим на следующую неделю?

00:07Спикер 2

К пятнице успеваем, если макеты придут завтра. Если позже, то реалистичнее вторник, и это я ещё не закладываю правки после ревью.

00:18Спикер 1

Понял. Тогда я тереблю дизайн сегодня, а ты пока начинаешь с той части, которая от макетов не зависит.

00:25Спикер 2

Договорились. И ещё момент: на прошлой неделе мы забыли записать решение по интеграции, потом полчаса вспоминали. Давай в этот раз зафиксируем сразу.

AI-саммари

Фрагмент рабочего созвона: обсуждают сроки по задаче и договариваются, кто отвечает за следующий шаг.

Устная речь звучит сплошным потоком, без точек и запятых, а в готовой расшифровке они уже стоят. Так работает автоматическая пунктуация: при переводе речи в текст мы восстанавливаем знаки препинания сами, по интонации и паузам говорящего. Отдельно включать это не нужно, и платить сверху за расстановку знаков тоже.

Сразу важная оговорка про формат работы. Мы расставляем знаки препинания из звука, а не из готового текста: сервис слышит речь и превращает её в пунктуированный текст с точностью распознавания WER 7,10%. Вставить набранный абзац без аудио, чтобы «просто добавить запятые», здесь нельзя – это другая задача.

Почему в устной речи нет знаков препинания

Знаки препинания – свойство письменного текста, а не звука. Когда человек говорит, он не произносит «точку» или «запятую»: границы предложений он передаёт интонацией, паузой и понижением голоса. Поэтому сырое распознавание речи без пунктуатора выглядит как один длинный ряд слов, который тяжело читать и невозможно цитировать.

Расшифровка восстанавливает эти границы обратно в графику. Мы анализируем, где говорящий сделал паузу, где закончил мысль, где задал вопрос, и ставим соответствующий знак. Работает это на любой записи со звуком – диктофон, телефон, видео, микрофон в браузере, – потому что опорой служит сама речь, а не формат файла.

Цена ошибки тут выше, чем кажется. От одной запятой смысл фразы меняется на противоположный, а сплошной текст без точек невозможно ни быстро прочитать, ни процитировать в документе. Поэтому расстановка знаков препинания – не косметика поверх распознавания, а часть того, что делает расшифровку пригодной для работы.

Как расшифровка расставляет знаки препинания

Расстановку знаков берёт на себя пунктуатор – отдельный шаг после распознавания слов. Он получает поток слов с их временными метками и решает, где поставить точку, запятую, вопросительный или восклицательный знак, а где разбить текст на предложения и абзацы. В результате из потока «предлагаю перейти к голосованию все за» получается «Предлагаю перейти к голосованию. Все за?».

Сигналы у пунктуатора простые по своей природе. Короткая пауза внутри мысли обычно даёт запятую, законченная интонация с понижением голоса – точку, а вопросительный подъём в конце реплики – знак вопроса. Дальше эти решения проверяются по словам вокруг: одни только паузы дали бы запятые где попало, поэтому модель смотрит и на контекст.

Кроме знаков внутри предложений мы делим текст на смысловые абзацы и раскладываем реплики по говорящим через диаризацию, с тайм-кодами. Обработка идёт быстро, порядка 1–2% от длительности записи, так что часовое совещание превращается в размеченный текст примерно за минуту. Работает пунктуация примерно на 100 языках, включая русский и языки СНГ.

Расшифровка с пунктуацией в цифрах: Точность, языки, цена и скорость Palatine Speech

Где автопунктуация ошибается и как это вычитать

Идеальной автопунктуации не бывает, и честнее сразу назвать слабые места. Опора на паузы и интонацию подводит там, где смысл неоднозначен: на омонимах, очень длинных фразах без явных пауз и на границе прямой речи. На чистой студийной записи таких мест единицы, на шумном диктофоне – больше.

Поэтому финальная вычитка остаётся за человеком, и это нормальный порядок работы с любой расшифровкой. Таблица ниже подсказывает, на что смотреть при правке.

Где чаще ошибкаПочемуЧто проверить при вычитке
Омонимы и вводные словаЗнак зависит от смысла, а не от паузыЗапятые вокруг «однако», «конечно», «значит»
Длинная фраза без паузНет сигнала о границе предложенияНе слиплись ли два предложения в одно
Прямая речь и цитатыКавычки и тире по интонации не слышныОформление реплик и цитат вручную
Шумная записьПаузы смазаны фономСпорные точки и запятые в шумных фрагментах

Где автопунктуация ошибается: Четыре места, которые стоит проверить при вычитке

Пунктуация, абзацы и деление на спикеров

Пунктуация в расшифровке работает вместе с разметкой структуры, а не отдельно от неё. Мало расставить запятые: чтобы текст читался, его нужно разбить на абзацы и показать, кто говорит. Мы делаем это в одном проходе – знаки препинания, абзацы и спикеры появляются вместе.

Для диалогов и совещаний это меняет читаемость сильнее, чем сами запятые. Реплика каждого участника идёт отдельным абзацем с тайм-кодом, знаки препинания стоят внутри неё, и по тексту сразу видно вопрос, ответ и реакцию. Такой же размеченный текст лежит в основе расшифровки звонков, где важно разделить оператора и клиента.

На длинных записях разметка экономит больше всего времени. В часовом интервью без абзацев и знаков нужный фрагмент искать бесполезно, а в размеченном тексте вы находите его по одному предложению и сразу видите его границы. Тайм-код рядом с репликой возвращает к нужной секунде аудио, если формулировку надо сверить на слух перед публикацией.

Как получить пунктуированный текст и в каких форматах

Чтобы получить текст со знаками препинания, загрузите запись файлом или наговорите её в микрофон – пунктуация появится в результате сама. Приёма по ссылке у нас нет: ролик с площадки сначала скачивают и загружают файлом. Отдельного режима «вставьте текст, а мы расставим знаки» тоже нет, потому что расстановка идёт из звука.

Готовый текст отдаётся в нескольких форматах, и пунктуация сохраняется в каждом.

ФорматЧто внутриКогда удобен
txtПунктуированный текст сплошнякомЧерновик статьи, заметка
json, verbose_jsonТекст + тайм-коды и спикерыРазбор и интеграция по API
srt, vttРеплики с пунктуацией и временемСубтитры к видео

Если нужно перенести распознавание в свой продукт, знаки препинания приходят и через аудио в текст в интерфейсе, и через OpenAI-совместимый API (POST /audio/transcriptions). Как устроено само распознавание под капотом, разбираем в статье как работает распознавание речи.

Не поток слов, а текст со знаками: Пунктуация восстанавливается из звука, по интонации и паузам

Сколько стоит и как попробовать

Отдельной платы за расстановку знаков препинания нет – она входит в расшифровку, которая стоит от 0,29 ₽/мин по модели pay-as-you-go. Вы платите только за обработанные минуты, баланс не сгорает, а секунды округляются вниз. Данные обрабатываются в 4 ЦОД уровня Tier III на территории РФ по 152-ФЗ.

Проверить качество пунктуации можно бесплатно на короткой записи. Перешлите аудио или голосовое в Telegram-бот @VoicePalatineBot – он обрабатывает до 100 записей в день без регистрации, и вы сразу увидите, как выглядит текст с восстановленными знаками.

Частые вопросы

  1. Ставятся ли знаки препинания автоматически? Да. При расшифровке мы восстанавливаем пунктуацию сами: точки, запятые, вопросительные знаки и деление на абзацы появляются в готовом тексте. Отдельно включать эту функцию не нужно, текст сразу читается как письменный.

  2. Можно ли вставить готовый текст, чтобы расставить знаки? Нет. Мы работаем со звуком, а не с текстом: расстановка знаков препинания идёт из речи, по интонации и паузам. Если знаки нужны в уже набранном тексте без аудио, это другая задача, и здесь она не решается.

  3. Почему в расшифровке иногда стоит не тот знак? Автопунктуация опирается на паузы и интонацию, поэтому спотыкается на омонимах, очень длинных фразах и границе прямой речи. На чистой записи ошибок мало, но финальную вычитку лучше оставить за человеком.

  4. Делит ли расшифровка текст на абзацы и спикеров? Да. Кроме знаков препинания мы разбиваем текст на абзацы по смыслу и раскладываем реплики по говорящим через диаризацию, с тайм-кодами. Сплошную стену текста читать не придётся.

  5. Насколько точная расшифровка? Точность распознавания – WER 7,10% и WAcc 92,9% по бенчмарку на 7 датасетах. Чем чище звук и разборчивее речь, тем меньше правок останется после автопунктуации.

  6. В каких форматах отдаётся текст с пунктуацией? Доступны txt, json, verbose_json, srt и vtt. В srt и vtt знаки препинания сохраняются внутри реплик субтитров, а в txt и json вы получаете обычный пунктуированный текст.

  7. Сколько это стоит? Распознавание с пунктуацией стоит от 0,29 ₽/мин по модели pay-as-you-go: отдельной платы за расстановку знаков нет, она входит в расшифровку.