Перетащите запись интервью или нажмите, чтобы выбратьMP3 · WAV · M4A · OGG · MP4 · до 30 минут
Пример результата – так выглядит готовая расшифровка
00:42РусскийСпикеры: 2
00:00Спикер 1

Расскажите, как вы сейчас разбираете записи после интервью?

00:05Спикер 2

Раньше отсматривала вручную, уходил весь вечер. Сейчас загружаю файл и через минуту читаю текст с тайм-кодами.

00:15Спикер 1

А что с несколькими собеседниками, их видно отдельно?

00:23Спикер 2

Да, реплики разведены по говорящим. На фокус-группе с перебиваниями приходится немного править руками.

AI-саммари

Фрагмент интервью: исследователь спрашивает про выбор инструмента, респондент отвечает.

Транскрибация интервью

Транскрибация интервью онлайн: расшифровка записи в текст с делением на спикеров и тайм-кодами. WAcc 92,9%, час интервью за минуту, от 0,29 ₽/мин, данные в РФ.

  • Диаризация по спикерам
  • Тайм-коды
  • WAcc 92,9%
  • от 0,29 ₽/мин
  • Данные в РФ (152-ФЗ)

Транскрибация интервью начинается в неприятный момент: беседа кончилась, на диске файл на 90 минут, а текст сдавать надо. Мы возвращаем расшифровку с делением на спикеров и тайм-кодами, час записи превращается в текст за минуту.

Принимаем мы файл в mp3, wav, m4a, ogg или aac либо запись с микрофона в браузере. Голосовое из мессенджера приходит в ogg, диктофон iPhone пишет m4a: оба грузятся как есть.

Что даёт расшифровка интервью

Как найти в записи одну фразу про второй раунд инвестиций? В тексте это ctrl+F, а тайм-код возвращает вас к нужной секунде звука. Глубинное интервью укладывается в типовые 45–90 минут и разворачивается в десятки стандартных страниц по 1800 знаков с пробелами.

В тематическом анализе Брауна и Кларк (2006) первая из шести фаз это знакомство с данными, и транскрибирование авторы относят прямо к ней: пока текста нет, кодировать нечего. Ориентир по объёму дала работа Геста, Банс и Джонсон (2006): насыщение выборки наступало примерно к двенадцатому интервью, основные темы проявлялись к шестому.

Запрос «перевести интервью в текст» означает расшифровку на том же языке: речь превращается в символы. Перевода на другой язык у нас нет, а языков распознаём около 100, русский и языки СНГ внутри.

Как расшифровать интервью: четыре шага

Модели распознавания работают на моно-дорожке 16 кГц, и вход всё равно приводится к ней: писать интервью в 44,1 кГц стерео смысла нет, речевой mp3 на 64 кбит/с моно (около 28 МБ на час против 115 МБ у несжатого wav) читается не хуже.

Расшифровка интервью онлайн устроена короче ручного набора: действий четыре.

  • Сохраните беседу файлом или включите микрофон, если интервью идёт прямо сейчас.
  • Загрузите файл в кабинет.
  • Подождите. Мы тратим 1–2% от длительности записи.
  • Выгрузите текст и пройдитесь глазами по именам собственным.

Телефонный канал живёт в стандарте G.711 (ITU-T, 1972): дискретизация 8 кГц, полоса примерно от 300 до 3400 Гц. Шум трения в согласных «с», «ш», «ф», «щ» лежит выше 4 кГц, ровно там, где канал отрезал сигнал, поэтому такие звуки путаются и точность на телефонной дорожке держится около 90%.

Комментарий Palatine Speech
На интервью ценность не в тексте, а в скорости возврата к нему. Пока расшифровка делается целый вечер, инсайт успевает остыть, а гайд к следующему респонденту уже отправлен. Мы держим обработку в пределах пары процентов от длительности записи, чтобы исследователь читал транскрипт в тот же день, когда провёл беседу.
Валерий ГречинCEO Palatine Speech

Точность и скорость: WER 7,10% против конкурентов

Расшифровка аудио интервью упирается в одну метрику. WER считают как сумму замен, пропусков и вставок, поделённую на число слов в эталонной расшифровке, а WAcc это то же самое с другой стороны, 100% минус WER. У нас 7,10% и 92,9% соответственно.

Разрыв в десятые доли процента решает меньше, чем микрофон. Разговорная речь в метре от него это около 60 дБ, фон в кафе даёт 70 дБ и выше.

Получасовое интервью отдаём примерно за 25 секунд, у Yandex SpeechKit на таком файле уходит порядка двух минут, у OpenAI около десяти.

Спикеры, тайм-коды и форматы выгрузки

Диаризация делит запись по говорящим, и расшифровка интервью с делением на спикеров читается как диалог, а не полотном. Качество деления мерят метрикой DER. Методические руководства держат фокус-группу в шесть-десять человек и полтора-два часа, перебивания там норма жанра, и такой транскрипт интервью придётся один раз пройти руками.

ФорматКогда подходитЧто на выходеГде ломается
txtпрочитать, отправить, вытащить цитатусплошной текст с репликамитайм-кодов нет
jsonзагрузка в скрипт или базуструктура с полямичитать глазами неудобно
verbose_jsonкодирование ответов, поиск по минутамсегменты со временем начала и концанужен редактор
srtсубтитры к видеоверсиинумерованные блоки, время вида 00:12:04,320длинную реплику делить самому
vttплеер на сайте, тег track в HTML5то же, но заголовок WEBVTT и точка в дробяхстарые плееры не читают

Про субтитры оговорка: практика титрования держит строку в пределах 40 знаков и двух строк на экран, а реплика респондента их перерастает почти всегда. Тот же набор отдаёт наш speech-to-text API, документация на docs.speech.palatine.ru, поток идёт по WebSocket.

Сколько стоит транскрибация интервью онлайн

Транскрибация интервью онлайн считается поминутно, от 0,29 ₽/мин, секунды мы округляем вниз. Часовая беседа обходится примерно в 17 ₽.

КаналКогда подходитГде ломаетсяЧто на выходе
Telegram-бот @VoicePalatineBotразовая запись, проверка качества, работа с телефонадо 100 транскрибаций в день; в переписке теряется, что уже расшифрованотекст ответным сообщением
Веб-кабинетсерия из двадцати интервью, вычитка, разные форматыфайлы загружаются руками, по одномулюбой из пяти форматов
APIпоток записей, свой продукт, сборка отчёта без ручной работынужен разработчик, вебхуков нет, статус опрашиваетсяjson или поток по WebSocket

Бот бесплатный, поэтому первую запись логично отправить ему. А серию лучше сразу вести в кабинете.

Кому нужен сервис для расшифровки интервью

Журналисту нужна дословная цитата и возможность её защитить: скажет герой «я такого не говорил», и тайм-код выведет вас на конкретную секунду. Статья 49 закона о СМИ (№ 2124-1 от 27 декабря 1991 года) обязывает журналиста ставить собеседника в известность об аудиозаписи.

А зачем рекрутёру расшифровка, если собеседование он вёл сам? Затем, что конспектировать на ходу не надо: к тексту вы вернётесь вечером, когда кандидаты после нескольких встреч слились в памяти в одного. Заодно по разметке видно, кто говорил больше: если интервьюер занял половину слота, ответов кандидата у вас, считай, нет.

UX-исследователь обращается с расшифровкой как с данными: кодирует ответы и переносит цитаты дословно, пересказ по памяти всегда мягче. «The Mom Test» Роба Фицпатрика (2013) требует спрашивать о прошлом поведении, а не о будущих намерениях, и в транскрипте видно, где вы сорвались в гипотетику.

Перед полевым этапом посмотрите, как проводить интервью. Когда расшифровок накопится десяток, пригодится разбор, как анализировать интервью. Записи с диктофона заводите через диктофон в текст, планёрки закрывает транскрибация встреч и совещаний.

Чего сервис не делает и где хранит записи

Ссылку на ролик вставить нельзя, мы принимаем файл или запись с микрофона. И смысловые акценты за вас никто не расставит: расшифровка остаётся сырьём.

Безопасно ли грузить записи с персональными данными? Согласие на обработку требует статья 9 закона № 152-ФЗ от 27 июля 2006 года, и берёте его вы, до начала записи. Наша часть проще: файлы лежат в четырёх ЦОД уровня Tier III на территории РФ, соединение шифруется по TLS, на записях клиентов модели не обучаются.

А если запись шумная? Вот с неё и начните: прогоните через бота беседу, где респондент частит и шумит кафе. Устроит текст, загружайте остальные файлы в кабинете.

Ответы на вопросы

Не нашли ответ на свой вопрос? Напишите нам

Как расшифровать интервью онлайн?

Сохраните беседу файлом в mp3, wav, m4a, ogg или aac либо включите запись с микрофона, загрузите в Palatine Speech и заберите готовый текст с тайм-кодами и разметкой по спикерам. Обработка займёт 1–2% от длительности файла.

Сколько стоит транскрибация интервью?

От 0,29 ₽/мин, оплата pay-as-you-go. Часовое интервью выходит примерно в 17 ₽, секунды округляются вниз, подписки нет, баланс не сгорает.

Есть ли бесплатный способ расшифровать интервью?

Да, Telegram-бот @VoicePalatineBot: до 100 транскрибаций в день. Перешлите ему голосовое или аудиофайл и получите текст в ответ. Под серию из двадцати глубинных интервью бот не заточен, там удобнее веб-кабинет или API.

Можно ли загрузить интервью по ссылке с YouTube или VK?

Нет, приём идёт только файлом или записью с микрофона. Если беседа опубликована на видеохостинге, сначала сохраните её файлом, а потом загружайте.

Сервис отличает интервьюера от респондента?

Да, за это отвечает диаризация: запись делится по говорящим, и транскрипт читается как диалог. На фокус-группе с перебиваниями границы реплик плывут, такой текст стоит один раз пройти руками.

Насколько точна расшифровка аудио интервью?

WER 7,10% и WAcc 92,9% на бенчмарке из семи датасетов. Телефонная запись на канале 8 кГц даёт около 90%: узкий канал срезает верхние частоты.

Переводит ли сервис интервью на другой язык?

Нет. Запрос «перевести интервью в текст» означает расшифровку на том же языке, речь превращается в символы. Распознаётся около 100 языков, включая русский и языки СНГ.

В каких форматах выгружается транскрипт интервью?

txt, json, verbose_json, srt и vtt. verbose_json отдаёт сегменты с тайм-кодами, а srt и vtt пригодятся, если у интервью есть видеоверсия и к ней нужны субтитры.

Безопасно ли загружать записи с персональными данными?

Записи обрабатываются в четырёх ЦОД уровня Tier III на территории РФ по 152-ФЗ, соединение шифруется по TLS. На файлах клиентов модели не обучаются.