Перетащите запись интервью или нажмите, чтобы выбратьMP3 · WAV · M4A · OGG · MP4 · до 30 минут
Пример результата – так выглядит готовая расшифровка
00:42РусскийСпикеры: 2
00:00Спикер 1

Расскажите, как вы сейчас разбираете записи после интервью?

00:05Спикер 2

Раньше отсматривала вручную, уходил весь вечер. Сейчас загружаю файл и через минуту читаю текст с тайм-кодами.

00:15Спикер 1

А что с несколькими собеседниками, их видно отдельно?

00:23Спикер 2

Да, реплики разведены по говорящим. На фокус-группе с перебиваниями приходится немного править руками.

AI-саммари

Фрагмент интервью: исследователь спрашивает про выбор инструмента, респондент отвечает.

Транскрибация интервью

Транскрибация интервью онлайн: расшифровка записи в текст с делением на спикеров и тайм-кодами. WAcc 92,9%, час интервью за минуту, от 0,29 ₽/мин, данные в РФ.

  • Диаризация по спикерам
  • Тайм-коды
  • WAcc 92,9%
  • от 0,29 ₽/мин
  • Данные в РФ (152-ФЗ)

Транскрибация интервью начинается в неприятный момент. Беседа кончилась, на диске файл на 90 минут, а сдавать надо текст. Мы отдаём расшифровку с делением на спикеров и тайм-кодами. Час записи мы обрабатываем за минуту. WAcc у нас 92,9% при WER 7,10% на бенчмарке из семи датасетов.

Принимаем мы только файл или запись с микрофона. Форматы mp3, wav, m4a, ogg и aac, либо вы жмёте запись в браузере. Ссылку мы не берём (запись с видеохостинга сначала сохраните файлом). Платите вы по минутам, от 0,29 ₽/мин, без подписки и без сгорающего пакета.

Сколько это в деньгах? Часовое интервью примерно 17 ₽.

Что даёт расшифровка интервью

Как найти в аудио одну фразу про второй раунд инвестиций? Журналист гоняет ползунок и промахивается, потому что в памяти осталась интонация. Минуту он не помнит. В тексте это ctrl+F. Расшифровка интервью превращает 90 минут звука в документ с поиском по слову.

А если бесед восемь?

Тогда вы кладёте восемь расшифровок в папку и смотрите, какая формулировка боли повторяется у всех, а какая прозвучала однажды.

Теперь про путаницу в словах. Запрос «перевести интервью в текст» означает расшифровку на том же языке. Речь мы превращаем в символы. Перевода на другой язык у нас нет. Языков мы распознаём около 100 (русский и языки СНГ внутри), и казахская беседа вернётся текстом на казахском.

Как расшифровать интервью: четыре шага

Ручная расшифровка идёт дольше самой записи. Набрали абзац, отмотали, отмотали ещё раз. Час беседы уходит в вечер.

А расшифровка интервью онлайн устроена короче. Сколько действий? Четыре, и думать вам придётся только над последним.

  • Сохраните беседу файлом. Голосовые из мессенджеров мы берём как есть, в ogg и m4a.
  • Загрузите аудиофайл к нам или включите микрофон, если интервью идёт сейчас.
  • Подождите. Мы тратим 1–2% от длительности файла (час записи это минута).
  • Выгрузите текст и пройдитесь глазами по именам собственным.

Зачем четвёртый шаг, если точность 92,9%? Имена собственные мы слышим по звуку. Незнакомый бренд запросто приедет к вам разделённым на два слова (особенно английский). Несколько минут вычитки закрывают вопрос.

А если запись телефонная? Канал 8 кГц срезает верхние частоты, и там мы держим около 90%. До 92,9% на такой дорожке мы не дотягиваем.

Комментарий Palatine Speech
На интервью ценность не в тексте, а в скорости возврата к нему. Пока расшифровка делается целый вечер, инсайт успевает остыть, а гайд к следующему респонденту уже отправлен. Мы держим обработку в пределах пары процентов от длительности записи, чтобы исследователь читал транскрипт в тот же день, когда провёл беседу.
Валерий ГречинCEO Palatine Speech

Точность и скорость: WER 7,10% против конкурентов

Расшифровка аудио интервью упирается в две цифры. WER 7,10% и WAcc 92,9% на семи датасетах. Первое место не наше, и врать тут смысла нет. ElevenLabs на том же наборе даёт 6,88%. AssemblyAI стоит вплотную с 7,03%, а Whisper-large-v3 показывает 7,44%.

Много это или мало? Разрыв между первым и третьим меньше, чем разница между петличкой и телефоном на столике в кафе. Микрофон решает больше движка.

Где мы отрываемся, так это в ожидании. Получасовое интервью мы отдаём примерно за 25 секунд.

СервисЗапись 30 минут
Palatine Speech≈25 секунд
Yandex SpeechKit~2 минуты
OpenAI~10 минут

На одном файле разница ничего не значит. Но вы приехали с поля с пятнадцатью записями, а синтез нужен к утру. А что делать с файлом на три часа? То же самое, наше правило 1–2% работает и на нём.

Спикеры, тайм-коды и форматы выгрузки

Диаризация делит запись по говорящим. Расшифровка интервью с делением на спикеров читается у нас как диалог. Сплошного полотна вы не получите. Один на один разметка выходит чистой, если собеседники не говорят хором.

А с фокус-группой хуже.

Когда четверо перебивают друг друга, границы реплик у нас плывут. И такой транскрипт интервью вам придётся один раз пройти руками.

В каком виде забирать транскрипт интервью? В txt, json, verbose_json, srt или vtt. verbose_json мы отдаём сегментами с тайм-кодами. srt и vtt пригодятся вам под субтитры, если у интервью есть видеоверсия. Тот же набор отдаёт наш speech-to-text API, документация на docs.speech.palatine.ru, поток по WebSocket. Вебхуков мы не сделали (статус задачи вы запрашиваете опросом).

Сколько стоит транскрибация интервью онлайн

Транскрибация интервью онлайн считается у нас поминутно, от 0,29 ₽/мин, секунды мы округляем вниз. За сорокапятиминутную беседу вы отдадите примерно 13 рублей (ставка та же, 0,29 ₽/мин). Подписки у нас нет, баланс не сгорает.

А бесплатно?

Бесплатно это наш Telegram-бот @VoicePalatineBot, до 100 транскрибаций в день. Перешлите ему голосовое или аудиофайл и получите текст в ответ. Под серию из двадцати глубинных интервью мы бот не затачивали (в переписке теряешь, что уже расшифровано), там вам нужен веб-кабинет или API. А на разовую задачу его хватает.

Кому нужен сервис для расшифровки интервью

Журналисту нужна дословная цитата и возможность её защитить. Скажет герой «я такого не говорил», и тайм-код выведет вас на конкретную секунду.

А зачем рекрутёру расшифровка, если собеседование он вёл сам? Затем, что конспектировать на ходу не надо. Вернётесь к тексту вечером, когда кандидатов было шесть за день и в голове они слиплись в одного. Заодно увидите, кто из двоих говорил больше и не съел ли рекрутёр половину слота. UX-исследователь обращается с нашей расшифровкой как с данными. Он кодирует ответы и переносит цитаты в отчёт дословно, потому что пересказ по памяти всегда мягче. Ему важно, чтобы восемь расшифровок были устроены одинаково. И отдельная боль это фокус-группа на четверых, там расшифровку правят руками.

Перед полевым этапом посмотрите, как проводить интервью. Половина проблем с текстом лечится в момент, когда вы решаете, куда положить телефон. А когда расшифровок накопится десяток, вам пригодится разбор, как анализировать интервью. Записи с диктофона заводите через диктофон в текст, планёрки закрывает транскрибация встреч и совещаний.

Чего сервис не делает и где хранит записи

Можно ли вставить ссылку на ролик?

Нельзя. Мы принимаем файл или запись с микрофона. Перевода на другой язык у нас нет, мы распознаём тот язык, на котором говорили. И смысловые акценты мы за вас не расставим, наша расшифровка остаётся сырьём.

Безопасно ли грузить к нам персональные данные? В интервью звучит имя собеседника и должность. Мы держим записи в четырёх ЦОД уровня Tier III на территории РФ по 152-ФЗ, соединение шифруем по TLS. И на файлах клиентов мы модели не обучаем.

А если запись шумная? Вот с неё и начните. Возьмите интервью, где респондент частит, шумит кафе, гремит посуда, а на двадцатой минуте официант приносит счёт. Прогоните файл через нашего бота и посмотрите на текст.

Ответы на вопросы

Не нашли ответ на свой вопрос? Напишите нам

Как расшифровать интервью онлайн?

Сохраните беседу файлом в mp3, wav, m4a, ogg или aac либо включите запись с микрофона, загрузите в Palatine Speech и заберите готовый текст с тайм-кодами и разметкой по спикерам. Обработка займёт 1–2% от длительности файла.

Сколько стоит транскрибация интервью?

От 0,29 ₽/мин, оплата pay-as-you-go. Часовое интервью выходит примерно в 17 ₽, секунды округляются вниз, подписки нет, баланс не сгорает.

Есть ли бесплатный способ расшифровать интервью?

Да, Telegram-бот @VoicePalatineBot: до 100 транскрибаций в день. Перешлите ему голосовое или аудиофайл и получите текст в ответ. Под серию из двадцати глубинных интервью бот не заточен, там удобнее веб-кабинет или API.

Можно ли загрузить интервью по ссылке с YouTube или VK?

Нет, приём идёт только файлом или записью с микрофона. Если беседа опубликована на видеохостинге, сначала сохраните её файлом, а потом загружайте.

Сервис отличает интервьюера от респондента?

Да, за это отвечает диаризация: запись делится по говорящим, и транскрипт читается как диалог. На фокус-группе с перебиваниями границы реплик плывут, такой текст стоит один раз пройти руками.

Насколько точна расшифровка аудио интервью?

WER 7,10% и WAcc 92,9% на бенчмарке из семи датасетов. Телефонная запись на канале 8 кГц даёт около 90%: узкий канал срезает верхние частоты.

Переводит ли сервис интервью на другой язык?

Нет. Запрос «перевести интервью в текст» означает расшифровку на том же языке, речь превращается в символы. Распознаётся около 100 языков, включая русский и языки СНГ.

В каких форматах выгружается транскрипт интервью?

txt, json, verbose_json, srt и vtt. verbose_json отдаёт сегменты с тайм-кодами, а srt и vtt пригодятся, если у интервью есть видеоверсия и к ней нужны субтитры.

Безопасно ли загружать записи с персональными данными?

Записи обрабатываются в четырёх ЦОД уровня Tier III на территории РФ по 152-ФЗ, соединение шифруется по TLS. На файлах клиентов модели не обучаются.