Транскрибация интервью
Транскрибация интервью онлайн: расшифровка записи в текст с делением на спикеров и тайм-кодами. WAcc 92,9%, час интервью за минуту, от 0,29 ₽/мин, данные в РФ.
- Диаризация по спикерам
- Тайм-коды
- WAcc 92,9%
- от 0,29 ₽/мин
- Данные в РФ (152-ФЗ)
Транскрибация интервью начинается в неприятный момент. Беседа кончилась, на диске файл на 90 минут, а сдавать надо текст. Мы отдаём расшифровку с делением на спикеров и тайм-кодами. Час записи мы обрабатываем за минуту. WAcc у нас 92,9% при WER 7,10% на бенчмарке из семи датасетов.
Принимаем мы только файл или запись с микрофона. Форматы mp3, wav, m4a, ogg и aac, либо вы жмёте запись в браузере. Ссылку мы не берём (запись с видеохостинга сначала сохраните файлом). Платите вы по минутам, от 0,29 ₽/мин, без подписки и без сгорающего пакета.
Сколько это в деньгах? Часовое интервью примерно 17 ₽.
Что даёт расшифровка интервью
Как найти в аудио одну фразу про второй раунд инвестиций? Журналист гоняет ползунок и промахивается, потому что в памяти осталась интонация. Минуту он не помнит. В тексте это ctrl+F. Расшифровка интервью превращает 90 минут звука в документ с поиском по слову.
А если бесед восемь?
Тогда вы кладёте восемь расшифровок в папку и смотрите, какая формулировка боли повторяется у всех, а какая прозвучала однажды.
Теперь про путаницу в словах. Запрос «перевести интервью в текст» означает расшифровку на том же языке. Речь мы превращаем в символы. Перевода на другой язык у нас нет. Языков мы распознаём около 100 (русский и языки СНГ внутри), и казахская беседа вернётся текстом на казахском.
Как расшифровать интервью: четыре шага
Ручная расшифровка идёт дольше самой записи. Набрали абзац, отмотали, отмотали ещё раз. Час беседы уходит в вечер.
А расшифровка интервью онлайн устроена короче. Сколько действий? Четыре, и думать вам придётся только над последним.
- Сохраните беседу файлом. Голосовые из мессенджеров мы берём как есть, в ogg и m4a.
- Загрузите аудиофайл к нам или включите микрофон, если интервью идёт сейчас.
- Подождите. Мы тратим 1–2% от длительности файла (час записи это минута).
- Выгрузите текст и пройдитесь глазами по именам собственным.
Зачем четвёртый шаг, если точность 92,9%? Имена собственные мы слышим по звуку. Незнакомый бренд запросто приедет к вам разделённым на два слова (особенно английский). Несколько минут вычитки закрывают вопрос.
А если запись телефонная? Канал 8 кГц срезает верхние частоты, и там мы держим около 90%. До 92,9% на такой дорожке мы не дотягиваем.
На интервью ценность не в тексте, а в скорости возврата к нему. Пока расшифровка делается целый вечер, инсайт успевает остыть, а гайд к следующему респонденту уже отправлен. Мы держим обработку в пределах пары процентов от длительности записи, чтобы исследователь читал транскрипт в тот же день, когда провёл беседу.
Точность и скорость: WER 7,10% против конкурентов
Расшифровка аудио интервью упирается в две цифры. WER 7,10% и WAcc 92,9% на семи датасетах. Первое место не наше, и врать тут смысла нет. ElevenLabs на том же наборе даёт 6,88%. AssemblyAI стоит вплотную с 7,03%, а Whisper-large-v3 показывает 7,44%.
Много это или мало? Разрыв между первым и третьим меньше, чем разница между петличкой и телефоном на столике в кафе. Микрофон решает больше движка.
Где мы отрываемся, так это в ожидании. Получасовое интервью мы отдаём примерно за 25 секунд.
| Сервис | Запись 30 минут |
|---|---|
| Palatine Speech | ≈25 секунд |
| Yandex SpeechKit | ~2 минуты |
| OpenAI | ~10 минут |
На одном файле разница ничего не значит. Но вы приехали с поля с пятнадцатью записями, а синтез нужен к утру. А что делать с файлом на три часа? То же самое, наше правило 1–2% работает и на нём.
Спикеры, тайм-коды и форматы выгрузки
Диаризация делит запись по говорящим. Расшифровка интервью с делением на спикеров читается у нас как диалог. Сплошного полотна вы не получите. Один на один разметка выходит чистой, если собеседники не говорят хором.
А с фокус-группой хуже.
Когда четверо перебивают друг друга, границы реплик у нас плывут. И такой транскрипт интервью вам придётся один раз пройти руками.
В каком виде забирать транскрипт интервью? В txt, json, verbose_json, srt или vtt. verbose_json мы отдаём сегментами с тайм-кодами. srt и vtt пригодятся вам под субтитры, если у интервью есть видеоверсия. Тот же набор отдаёт наш speech-to-text API, документация на docs.speech.palatine.ru, поток по WebSocket. Вебхуков мы не сделали (статус задачи вы запрашиваете опросом).
Сколько стоит транскрибация интервью онлайн
Транскрибация интервью онлайн считается у нас поминутно, от 0,29 ₽/мин, секунды мы округляем вниз. За сорокапятиминутную беседу вы отдадите примерно 13 рублей (ставка та же, 0,29 ₽/мин). Подписки у нас нет, баланс не сгорает.
А бесплатно?
Бесплатно это наш Telegram-бот @VoicePalatineBot, до 100 транскрибаций в день. Перешлите ему голосовое или аудиофайл и получите текст в ответ. Под серию из двадцати глубинных интервью мы бот не затачивали (в переписке теряешь, что уже расшифровано), там вам нужен веб-кабинет или API. А на разовую задачу его хватает.
Кому нужен сервис для расшифровки интервью
Журналисту нужна дословная цитата и возможность её защитить. Скажет герой «я такого не говорил», и тайм-код выведет вас на конкретную секунду.
А зачем рекрутёру расшифровка, если собеседование он вёл сам? Затем, что конспектировать на ходу не надо. Вернётесь к тексту вечером, когда кандидатов было шесть за день и в голове они слиплись в одного. Заодно увидите, кто из двоих говорил больше и не съел ли рекрутёр половину слота. UX-исследователь обращается с нашей расшифровкой как с данными. Он кодирует ответы и переносит цитаты в отчёт дословно, потому что пересказ по памяти всегда мягче. Ему важно, чтобы восемь расшифровок были устроены одинаково. И отдельная боль это фокус-группа на четверых, там расшифровку правят руками.
Перед полевым этапом посмотрите, как проводить интервью. Половина проблем с текстом лечится в момент, когда вы решаете, куда положить телефон. А когда расшифровок накопится десяток, вам пригодится разбор, как анализировать интервью. Записи с диктофона заводите через диктофон в текст, планёрки закрывает транскрибация встреч и совещаний.
Чего сервис не делает и где хранит записи
Можно ли вставить ссылку на ролик?
Нельзя. Мы принимаем файл или запись с микрофона. Перевода на другой язык у нас нет, мы распознаём тот язык, на котором говорили. И смысловые акценты мы за вас не расставим, наша расшифровка остаётся сырьём.
Безопасно ли грузить к нам персональные данные? В интервью звучит имя собеседника и должность. Мы держим записи в четырёх ЦОД уровня Tier III на территории РФ по 152-ФЗ, соединение шифруем по TLS. И на файлах клиентов мы модели не обучаем.
А если запись шумная? Вот с неё и начните. Возьмите интервью, где респондент частит, шумит кафе, гремит посуда, а на двадцатой минуте официант приносит счёт. Прогоните файл через нашего бота и посмотрите на текст.
Ответы на вопросы
Не нашли ответ на свой вопрос? Напишите нам
Как расшифровать интервью онлайн?
Сохраните беседу файлом в mp3, wav, m4a, ogg или aac либо включите запись с микрофона, загрузите в Palatine Speech и заберите готовый текст с тайм-кодами и разметкой по спикерам. Обработка займёт 1–2% от длительности файла.
Сколько стоит транскрибация интервью?
От 0,29 ₽/мин, оплата pay-as-you-go. Часовое интервью выходит примерно в 17 ₽, секунды округляются вниз, подписки нет, баланс не сгорает.
Есть ли бесплатный способ расшифровать интервью?
Да, Telegram-бот @VoicePalatineBot: до 100 транскрибаций в день. Перешлите ему голосовое или аудиофайл и получите текст в ответ. Под серию из двадцати глубинных интервью бот не заточен, там удобнее веб-кабинет или API.
Можно ли загрузить интервью по ссылке с YouTube или VK?
Нет, приём идёт только файлом или записью с микрофона. Если беседа опубликована на видеохостинге, сначала сохраните её файлом, а потом загружайте.
Сервис отличает интервьюера от респондента?
Да, за это отвечает диаризация: запись делится по говорящим, и транскрипт читается как диалог. На фокус-группе с перебиваниями границы реплик плывут, такой текст стоит один раз пройти руками.
Насколько точна расшифровка аудио интервью?
WER 7,10% и WAcc 92,9% на бенчмарке из семи датасетов. Телефонная запись на канале 8 кГц даёт около 90%: узкий канал срезает верхние частоты.
Переводит ли сервис интервью на другой язык?
Нет. Запрос «перевести интервью в текст» означает расшифровку на том же языке, речь превращается в символы. Распознаётся около 100 языков, включая русский и языки СНГ.
В каких форматах выгружается транскрипт интервью?
txt, json, verbose_json, srt и vtt. verbose_json отдаёт сегменты с тайм-кодами, а srt и vtt пригодятся, если у интервью есть видеоверсия и к ней нужны субтитры.
Безопасно ли загружать записи с персональными данными?
Записи обрабатываются в четырёх ЦОД уровня Tier III на территории РФ по 152-ФЗ, соединение шифруется по TLS. На файлах клиентов модели не обучаются.