Перетащите запись интервью или нажмите, чтобы выбратьMP3 · WAV · M4A · OGG · MP4 · до 30 минут
Пример результата – так выглядит готовая расшифровка
00:42РусскийСпикеры: 2
00:00Спикер 1

Расскажите, как вы сейчас разбираете записи после интервью?

00:05Спикер 2

Раньше отсматривала вручную, уходил весь вечер. Сейчас загружаю файл и через минуту читаю текст с тайм-кодами.

00:15Спикер 1

А что с несколькими собеседниками, их видно отдельно?

00:23Спикер 2

Да, реплики разведены по говорящим. На фокус-группе с перебиваниями приходится немного править руками.

AI-саммари

Фрагмент интервью: исследователь спрашивает про выбор инструмента, респондент отвечает.

Транскрибация для журналистов

Расшифровка интервью, диктофона и пресс-конференций для журналистов: точность WER 7,10%, деление по спикерам, тайм-коды для сверки цитат. От 0,29 ₽/мин, данные в РФ (152-ФЗ).

  • Точность 92,9% (WER 7,10%)
  • Спикеры и тайм-коды
  • ~100 языков
  • 152-ФЗ · данные в РФ
  • от 0,29 ₽/мин

Интервью записано, а в номер нужен текст с точными цитатами. Загрузите запись с диктофона или телефона, и транскрибация для журналистов переведёт её в текст: мы распознаём речь с точностью WER 7,10% и раскладываем реплики по говорящим. Часовой разговор становится текстом примерно за минуту, а не за половину смены ручной расшифровки.

И это не только сама расшифровка интервью. Мы ставим тайм-код к каждой реплике, поэтому нужную фразу вы находите за секунды и сверяете формулировку с аудио перед публикацией. Устанавливать ничего не нужно, а язык записи остаётся прежним: сказали по-русски – получите русский текст.

Что даёт транскрибация для журналиста

Транскрибация для журналиста – это распознавание речи под конкретную задачу: интервью, диктофонную запись или пресс-конференцию мы превращаем в редактируемый текст на том же языке. Распознаётся около 100 языков, включая русский и языки СНГ, но перевода на другой язык здесь нет. Перевести интервью в текст значит расшифровать его, а не переложить на английский.

Работать при этом можно с чем угодно, где есть звук. Диктофон, телефон, видеозапись брифинга, микрофон в браузере – мы одинаково расшифровываем и загруженный файл, и живую диктовку. Из видео берётся звуковая дорожка, так что формат исходника роли не играет: значение имеют разборчивость речи и фоновый шум.

Телефонное интервью – отдельный случай, и его мы обрабатываем моделью под телефонию. На узком канале 8 кГц, где универсальные движки проседают, точность держится около 90%, поэтому запись разговора по телефону тоже превращается в пригодный для правки текст, а не в кашу.

Транскрибация для журналистов в цифрах: Точность, скорость и цена расшифровки интервью в Palatine Speech

Расшифровка интервью: спикеры и тайм-коды

Расшифровка интервью для журналиста нужна не просто «текстом», а с разметкой, кто что сказал. Диаризация делит реплики по говорящим и ставит тайм-код к каждой, поэтому в готовом тексте видно, где вопрос журналиста, а где ответ собеседника. Не приходится вручную помечать реплики и переслушивать запись по второму кругу.

Тайм-код экономит время именно на сверке цитат. Вы находите нужную минуту записи по тексту, открываете её в один клик и проверяете точную формулировку перед тем, как поставить её в кавычки. Для часового интервью это разница между парой минут и получасом перемотки на слух.

Записи и источники под защитой: Где хранятся интервью и что с ними происходит

Комментарий Palatine Speech
Журналисту важны не форматы файлов, а точная цитата и скорость. Поэтому мы раскладываем реплики по говорящим и ставим тайм-код к каждой: формулировку собеседника можно сверить с аудио за секунды, а часовое интервью расшифровать примерно за минуту, а не за половину рабочего дня вручную.
Валерий ГречинCEO Palatine Speech

Пресс-конференции и панели: много говорящих

На пресс-конференции или панельной дискуссии говорят несколько человек, и обычная расшифровка сливает их в сплошную стену текста. Мы раскладываем такую запись по спикерам, поэтому реплики модератора, спикеров и вопросы из зала не смешиваются. Даже на записи в полтора-два часа видно, кто автор конкретной фразы.

Дальше по тексту работает поиск и те же тайм-коды. Нужен фрагмент про одну тему из длинного брифинга – находите его по слову, а не пролистываете запись целиком. Если материал большой, соберите из расшифровки саммари из аудио с тезисами и цитатами, чтобы быстрее собрать заметку.

От диктофона до пресс-конференции: Какой источник записи что даёт на выходе

Точные цитаты и скорость под дедлайн

Под дедлайн решают две вещи: насколько точно распознана речь и как быстро готов текст. Точность распознавания у нас – WER 7,10% и WAcc 92,9% по бенчмарку на 7 датасетах, так что на выходе связный текст, а не черновик, который переписываешь заново. Ниже – сравнение по WER с другими движками.

Скорость тоже измеримая: обработка идёт примерно за 1–2% от длительности файла. Часовая запись превращается в текст за минуту-другую, запись пресс-конференции на два часа – за пару-тройку минут. Успеваете вычитать и поставить цитаты, а не сидеть смену с наушниками над диктофоном.

Форматы записи и экспорт

Расшифровка диктофонной записи, телефонного разговора или видео идёт по одному сценарию, а вот выгрузка зависит от материала. Текст отдаём в txt, json, verbose_json, srt и vtt: первые – для заметки и правки, srt и vtt – как готовые субтитры к видео-репортажу. Тайм-коды сохраняются во всех форматах с временем.

Таблица ниже подсказывает, что под какую задачу подходит.

Источник записиКогда подходитЧто на выходе
Диктофон, телефон (mp3, m4a)Интервью один на один, разговор для статьиТекст со спикерами и тайм-кодами
Видеозапись брифинга (mp4)Пресс-конференция, панель, репортажТекст + субтитры srt/vtt
Микрофон в браузереДиктовка заметок и черновика на ходуТекст в реальном времени

Если исходник – ролик с платформы, сначала скачайте его и загрузите файлом: приёма по ссылке у нас нет. Отдельно лежит расшифровка диктофона с разбором форматов записи.

Безопасность записей и защита источников

Интервью нередко содержит то, что защищает источник, поэтому хранение записей важно не меньше точности. Записи обрабатываются и хранятся в 4 ЦОД уровня Tier III на территории РФ по 152-ФЗ, соединение защищено TLS. На данных клиентов модели не обучаются, так что материал не утекает в обучающую выборку.

Работа с текстом остаётся у вас. Готовую расшифровку вы выгружаете себе и удаляете из сервиса, а внутри редакции распознавание подключается через OpenAI-совместимый API (POST /audio/transcriptions) – и для готовых файлов, и для потока по WebSocket.

Сколько стоит и как попробовать бесплатно

Расшифровка тарифицируется от 0,29 ₽/мин по модели pay-as-you-go: вы платите только за обработанные минуты, баланс не сгорает, а секунды округляются вниз. Часовое интервью обходится в считанные рубли, отдельная подписка не нужна.

Для коротких записей есть бесплатный вход. Перешлите аудио или войс в Telegram-бот расшифровки @VoicePalatineBot – он обрабатывает до 100 записей в день без регистрации. Так удобно расшифровывать короткие комментарии и голосовые прямо с телефона, а длинные интервью загружать в основной сервис.

Точность распознавания (WER, меньше – лучше)

Palatine SpeechElevenLabsAssemblyAIWhisper-large-v3
WER (бенчмарк на 7 датасетах)7,10%6,88%7,03%7,44%

WER (бенчмарк на 7 датасетах)

Palatine Speech
7,10%
ElevenLabs
6,88%
AssemblyAI
7,03%
Whisper-large-v3
7,44%

Сколько стоит расшифровка

0,29 ₽/мин, pay-as-you-go. Объёмы для бизнеса выделяем по запросу. Баланс не сгорает, секунды округляются вниз.

Длительность аудио600мин · 10 ч
10 мин6 000 мин
✓ Укладывается в 1 000 бесплатных минут – по запросу
Итого за обработку
174
Новым пользователям 1 000 минут бесплатно – выделяем по запросу

Ответы на вопросы

Не нашли ответ на свой вопрос? Напишите нам

Как расшифровать интервью в текст?

Загрузите запись с диктофона или телефона либо наговорите в микрофон в браузере, запустите распознавание и заберите готовый текст. Обработка занимает около 1–2% от длительности записи, поэтому часовое интервью готово примерно за минуту.

Разложит ли сервис запись по говорящим?

Да. Диаризация делит реплики по спикерам и ставит тайм-код к каждой, так что видно, где говорит журналист, а где собеседник. На пресс-конференции с несколькими участниками реплики тоже разложены по говорящим.

Можно ли расшифровать интервью бесплатно?

Короткие записи и войсы примет Telegram-бот @VoicePalatineBot – до 100 транскрибаций в день. Перешлите ему аудио и получите текст, регистрация не нужна.

Насколько точная расшифровка?

Точность распознавания – WER 7,10% и WAcc 92,9% по бенчмарку на 7 датасетах. Для сравнения, Whisper-large-v3 показывает WER 7,44%. На выходе получается связный текст, а не набор слов, который придётся переписывать.

Можно ли расшифровать ролик по ссылке с YouTube?

Приём по ссылке мы не делаем: скачайте ролик и загрузите его файлом. Из видео сервис берёт звуковую дорожку и расшифровывает её так же, как обычную запись.

В каких форматах отдаётся текст?

Доступны txt, json, verbose_json, srt и vtt – с тайм-кодами и делением на спикеров. Форматы srt и vtt сразу годятся как субтитры к видео-репортажу.

Успеет ли расшифровка под дедлайн?

Обработка идёт со скоростью примерно 1–2% от длительности файла: часовая запись превращается в текст за минуту-другую, а не за смену расшифровки вручную.

Безопасно ли это для источников?

Записи обрабатываются и хранятся в 4 ЦОД уровня Tier III на территории РФ по 152-ФЗ, соединение защищено TLS. На данных клиентов модели не обучаются.