Транскрибация для журналистов
Расшифровка интервью, диктофона и пресс-конференций для журналистов: точность WER 7,10%, деление по спикерам, тайм-коды для сверки цитат. От 0,29 ₽/мин, данные в РФ (152-ФЗ).
- Точность 92,9% (WER 7,10%)
- Спикеры и тайм-коды
- ~100 языков
- 152-ФЗ · данные в РФ
- от 0,29 ₽/мин
Интервью записано, а в номер нужен текст с точными цитатами. Загрузите запись с диктофона или телефона, и транскрибация для журналистов переведёт её в текст: мы распознаём речь с точностью WER 7,10% и раскладываем реплики по говорящим. Часовой разговор становится текстом примерно за минуту, а не за половину смены ручной расшифровки.
И это не только сама расшифровка интервью. Мы ставим тайм-код к каждой реплике, поэтому нужную фразу вы находите за секунды и сверяете формулировку с аудио перед публикацией. Устанавливать ничего не нужно, а язык записи остаётся прежним: сказали по-русски – получите русский текст.
Что даёт транскрибация для журналиста
Транскрибация для журналиста – это распознавание речи под конкретную задачу: интервью, диктофонную запись или пресс-конференцию мы превращаем в редактируемый текст на том же языке. Распознаётся около 100 языков, включая русский и языки СНГ, но перевода на другой язык здесь нет. Перевести интервью в текст значит расшифровать его, а не переложить на английский.
Работать при этом можно с чем угодно, где есть звук. Диктофон, телефон, видеозапись брифинга, микрофон в браузере – мы одинаково расшифровываем и загруженный файл, и живую диктовку. Из видео берётся звуковая дорожка, так что формат исходника роли не играет: значение имеют разборчивость речи и фоновый шум.
Телефонное интервью – отдельный случай, и его мы обрабатываем моделью под телефонию. На узком канале 8 кГц, где универсальные движки проседают, точность держится около 90%, поэтому запись разговора по телефону тоже превращается в пригодный для правки текст, а не в кашу.

Расшифровка интервью: спикеры и тайм-коды
Расшифровка интервью для журналиста нужна не просто «текстом», а с разметкой, кто что сказал. Диаризация делит реплики по говорящим и ставит тайм-код к каждой, поэтому в готовом тексте видно, где вопрос журналиста, а где ответ собеседника. Не приходится вручную помечать реплики и переслушивать запись по второму кругу.
Тайм-код экономит время именно на сверке цитат. Вы находите нужную минуту записи по тексту, открываете её в один клик и проверяете точную формулировку перед тем, как поставить её в кавычки. Для часового интервью это разница между парой минут и получасом перемотки на слух.

Журналисту важны не форматы файлов, а точная цитата и скорость. Поэтому мы раскладываем реплики по говорящим и ставим тайм-код к каждой: формулировку собеседника можно сверить с аудио за секунды, а часовое интервью расшифровать примерно за минуту, а не за половину рабочего дня вручную.
Пресс-конференции и панели: много говорящих
На пресс-конференции или панельной дискуссии говорят несколько человек, и обычная расшифровка сливает их в сплошную стену текста. Мы раскладываем такую запись по спикерам, поэтому реплики модератора, спикеров и вопросы из зала не смешиваются. Даже на записи в полтора-два часа видно, кто автор конкретной фразы.
Дальше по тексту работает поиск и те же тайм-коды. Нужен фрагмент про одну тему из длинного брифинга – находите его по слову, а не пролистываете запись целиком. Если материал большой, соберите из расшифровки саммари из аудио с тезисами и цитатами, чтобы быстрее собрать заметку.

Точные цитаты и скорость под дедлайн
Под дедлайн решают две вещи: насколько точно распознана речь и как быстро готов текст. Точность распознавания у нас – WER 7,10% и WAcc 92,9% по бенчмарку на 7 датасетах, так что на выходе связный текст, а не черновик, который переписываешь заново. Ниже – сравнение по WER с другими движками.
Скорость тоже измеримая: обработка идёт примерно за 1–2% от длительности файла. Часовая запись превращается в текст за минуту-другую, запись пресс-конференции на два часа – за пару-тройку минут. Успеваете вычитать и поставить цитаты, а не сидеть смену с наушниками над диктофоном.
Форматы записи и экспорт
Расшифровка диктофонной записи, телефонного разговора или видео идёт по одному сценарию, а вот выгрузка зависит от материала. Текст отдаём в txt, json, verbose_json, srt и vtt: первые – для заметки и правки, srt и vtt – как готовые субтитры к видео-репортажу. Тайм-коды сохраняются во всех форматах с временем.
Таблица ниже подсказывает, что под какую задачу подходит.
| Источник записи | Когда подходит | Что на выходе |
|---|---|---|
| Диктофон, телефон (mp3, m4a) | Интервью один на один, разговор для статьи | Текст со спикерами и тайм-кодами |
| Видеозапись брифинга (mp4) | Пресс-конференция, панель, репортаж | Текст + субтитры srt/vtt |
| Микрофон в браузере | Диктовка заметок и черновика на ходу | Текст в реальном времени |
Если исходник – ролик с платформы, сначала скачайте его и загрузите файлом: приёма по ссылке у нас нет. Отдельно лежит расшифровка диктофона с разбором форматов записи.
Безопасность записей и защита источников
Интервью нередко содержит то, что защищает источник, поэтому хранение записей важно не меньше точности. Записи обрабатываются и хранятся в 4 ЦОД уровня Tier III на территории РФ по 152-ФЗ, соединение защищено TLS. На данных клиентов модели не обучаются, так что материал не утекает в обучающую выборку.
Работа с текстом остаётся у вас. Готовую расшифровку вы выгружаете себе и удаляете из сервиса, а внутри редакции распознавание подключается через OpenAI-совместимый API (POST /audio/transcriptions) – и для готовых файлов, и для потока по WebSocket.
Сколько стоит и как попробовать бесплатно
Расшифровка тарифицируется от 0,29 ₽/мин по модели pay-as-you-go: вы платите только за обработанные минуты, баланс не сгорает, а секунды округляются вниз. Часовое интервью обходится в считанные рубли, отдельная подписка не нужна.
Для коротких записей есть бесплатный вход. Перешлите аудио или войс в Telegram-бот расшифровки @VoicePalatineBot – он обрабатывает до 100 записей в день без регистрации. Так удобно расшифровывать короткие комментарии и голосовые прямо с телефона, а длинные интервью загружать в основной сервис.
Ответы на вопросы
Не нашли ответ на свой вопрос? Напишите нам
Как расшифровать интервью в текст?
Загрузите запись с диктофона или телефона либо наговорите в микрофон в браузере, запустите распознавание и заберите готовый текст. Обработка занимает около 1–2% от длительности записи, поэтому часовое интервью готово примерно за минуту.
Разложит ли сервис запись по говорящим?
Да. Диаризация делит реплики по спикерам и ставит тайм-код к каждой, так что видно, где говорит журналист, а где собеседник. На пресс-конференции с несколькими участниками реплики тоже разложены по говорящим.
Можно ли расшифровать интервью бесплатно?
Короткие записи и войсы примет Telegram-бот @VoicePalatineBot – до 100 транскрибаций в день. Перешлите ему аудио и получите текст, регистрация не нужна.
Насколько точная расшифровка?
Точность распознавания – WER 7,10% и WAcc 92,9% по бенчмарку на 7 датасетах. Для сравнения, Whisper-large-v3 показывает WER 7,44%. На выходе получается связный текст, а не набор слов, который придётся переписывать.
Можно ли расшифровать ролик по ссылке с YouTube?
Приём по ссылке мы не делаем: скачайте ролик и загрузите его файлом. Из видео сервис берёт звуковую дорожку и расшифровывает её так же, как обычную запись.
В каких форматах отдаётся текст?
Доступны txt, json, verbose_json, srt и vtt – с тайм-кодами и делением на спикеров. Форматы srt и vtt сразу годятся как субтитры к видео-репортажу.
Успеет ли расшифровка под дедлайн?
Обработка идёт со скоростью примерно 1–2% от длительности файла: часовая запись превращается в текст за минуту-другую, а не за смену расшифровки вручную.
Безопасно ли это для источников?
Записи обрабатываются и хранятся в 4 ЦОД уровня Tier III на территории РФ по 152-ФЗ, соединение защищено TLS. На данных клиентов модели не обучаются.