Транскрибация интервью
Транскрибация интервью онлайн: расшифровка записи в текст с делением на спикеров и тайм-кодами. WAcc 92,9%, час интервью за минуту, от 0,29 ₽/мин, данные в РФ.
- Диаризация по спикерам
- Тайм-коды
- WAcc 92,9%
- от 0,29 ₽/мин
- Данные в РФ (152-ФЗ)
Транскрибация интервью начинается в неприятный момент: беседа кончилась, на диске файл на 90 минут, а текст сдавать надо. Мы возвращаем расшифровку с делением на спикеров и тайм-кодами, час записи превращается в текст за минуту.
Принимаем мы файл в mp3, wav, m4a, ogg или aac либо запись с микрофона в браузере. Голосовое из мессенджера приходит в ogg, диктофон iPhone пишет m4a: оба грузятся как есть.
Что даёт расшифровка интервью
Как найти в записи одну фразу про второй раунд инвестиций? В тексте это ctrl+F, а тайм-код возвращает вас к нужной секунде звука. Глубинное интервью укладывается в типовые 45–90 минут и разворачивается в десятки стандартных страниц по 1800 знаков с пробелами.
В тематическом анализе Брауна и Кларк (2006) первая из шести фаз это знакомство с данными, и транскрибирование авторы относят прямо к ней: пока текста нет, кодировать нечего. Ориентир по объёму дала работа Геста, Банс и Джонсон (2006): насыщение выборки наступало примерно к двенадцатому интервью, основные темы проявлялись к шестому.
Запрос «перевести интервью в текст» означает расшифровку на том же языке: речь превращается в символы. Перевода на другой язык у нас нет, а языков распознаём около 100, русский и языки СНГ внутри.
Как расшифровать интервью: четыре шага
Модели распознавания работают на моно-дорожке 16 кГц, и вход всё равно приводится к ней: писать интервью в 44,1 кГц стерео смысла нет, речевой mp3 на 64 кбит/с моно (около 28 МБ на час против 115 МБ у несжатого wav) читается не хуже.
Расшифровка интервью онлайн устроена короче ручного набора: действий четыре.
- Сохраните беседу файлом или включите микрофон, если интервью идёт прямо сейчас.
- Загрузите файл в кабинет.
- Подождите. Мы тратим 1–2% от длительности записи.
- Выгрузите текст и пройдитесь глазами по именам собственным.
Телефонный канал живёт в стандарте G.711 (ITU-T, 1972): дискретизация 8 кГц, полоса примерно от 300 до 3400 Гц. Шум трения в согласных «с», «ш», «ф», «щ» лежит выше 4 кГц, ровно там, где канал отрезал сигнал, поэтому такие звуки путаются и точность на телефонной дорожке держится около 90%.
На интервью ценность не в тексте, а в скорости возврата к нему. Пока расшифровка делается целый вечер, инсайт успевает остыть, а гайд к следующему респонденту уже отправлен. Мы держим обработку в пределах пары процентов от длительности записи, чтобы исследователь читал транскрипт в тот же день, когда провёл беседу.
Точность и скорость: WER 7,10% против конкурентов
Расшифровка аудио интервью упирается в одну метрику. WER считают как сумму замен, пропусков и вставок, поделённую на число слов в эталонной расшифровке, а WAcc это то же самое с другой стороны, 100% минус WER. У нас 7,10% и 92,9% соответственно.
Разрыв в десятые доли процента решает меньше, чем микрофон. Разговорная речь в метре от него это около 60 дБ, фон в кафе даёт 70 дБ и выше.
Получасовое интервью отдаём примерно за 25 секунд, у Yandex SpeechKit на таком файле уходит порядка двух минут, у OpenAI около десяти.
Спикеры, тайм-коды и форматы выгрузки
Диаризация делит запись по говорящим, и расшифровка интервью с делением на спикеров читается как диалог, а не полотном. Качество деления мерят метрикой DER. Методические руководства держат фокус-группу в шесть-десять человек и полтора-два часа, перебивания там норма жанра, и такой транскрипт интервью придётся один раз пройти руками.
| Формат | Когда подходит | Что на выходе | Где ломается |
|---|---|---|---|
| txt | прочитать, отправить, вытащить цитату | сплошной текст с репликами | тайм-кодов нет |
| json | загрузка в скрипт или базу | структура с полями | читать глазами неудобно |
| verbose_json | кодирование ответов, поиск по минутам | сегменты со временем начала и конца | нужен редактор |
| srt | субтитры к видеоверсии | нумерованные блоки, время вида 00:12:04,320 | длинную реплику делить самому |
| vtt | плеер на сайте, тег track в HTML5 | то же, но заголовок WEBVTT и точка в дробях | старые плееры не читают |
Про субтитры оговорка: практика титрования держит строку в пределах 40 знаков и двух строк на экран, а реплика респондента их перерастает почти всегда. Тот же набор отдаёт наш speech-to-text API, документация на docs.speech.palatine.ru, поток идёт по WebSocket.
Сколько стоит транскрибация интервью онлайн
Транскрибация интервью онлайн считается поминутно, от 0,29 ₽/мин, секунды мы округляем вниз. Часовая беседа обходится примерно в 17 ₽.
| Канал | Когда подходит | Где ломается | Что на выходе |
|---|---|---|---|
| Telegram-бот @VoicePalatineBot | разовая запись, проверка качества, работа с телефона | до 100 транскрибаций в день; в переписке теряется, что уже расшифровано | текст ответным сообщением |
| Веб-кабинет | серия из двадцати интервью, вычитка, разные форматы | файлы загружаются руками, по одному | любой из пяти форматов |
| API | поток записей, свой продукт, сборка отчёта без ручной работы | нужен разработчик, вебхуков нет, статус опрашивается | json или поток по WebSocket |
Бот бесплатный, поэтому первую запись логично отправить ему. А серию лучше сразу вести в кабинете.
Кому нужен сервис для расшифровки интервью
Журналисту нужна дословная цитата и возможность её защитить: скажет герой «я такого не говорил», и тайм-код выведет вас на конкретную секунду. Статья 49 закона о СМИ (№ 2124-1 от 27 декабря 1991 года) обязывает журналиста ставить собеседника в известность об аудиозаписи.
А зачем рекрутёру расшифровка, если собеседование он вёл сам? Затем, что конспектировать на ходу не надо: к тексту вы вернётесь вечером, когда кандидаты после нескольких встреч слились в памяти в одного. Заодно по разметке видно, кто говорил больше: если интервьюер занял половину слота, ответов кандидата у вас, считай, нет.
UX-исследователь обращается с расшифровкой как с данными: кодирует ответы и переносит цитаты дословно, пересказ по памяти всегда мягче. «The Mom Test» Роба Фицпатрика (2013) требует спрашивать о прошлом поведении, а не о будущих намерениях, и в транскрипте видно, где вы сорвались в гипотетику.
Перед полевым этапом посмотрите, как проводить интервью. Когда расшифровок накопится десяток, пригодится разбор, как анализировать интервью. Записи с диктофона заводите через диктофон в текст, планёрки закрывает транскрибация встреч и совещаний.
Чего сервис не делает и где хранит записи
Ссылку на ролик вставить нельзя, мы принимаем файл или запись с микрофона. И смысловые акценты за вас никто не расставит: расшифровка остаётся сырьём.
Безопасно ли грузить записи с персональными данными? Согласие на обработку требует статья 9 закона № 152-ФЗ от 27 июля 2006 года, и берёте его вы, до начала записи. Наша часть проще: файлы лежат в четырёх ЦОД уровня Tier III на территории РФ, соединение шифруется по TLS, на записях клиентов модели не обучаются.
А если запись шумная? Вот с неё и начните: прогоните через бота беседу, где респондент частит и шумит кафе. Устроит текст, загружайте остальные файлы в кабинете.
Ответы на вопросы
Не нашли ответ на свой вопрос? Напишите нам
Как расшифровать интервью онлайн?
Сохраните беседу файлом в mp3, wav, m4a, ogg или aac либо включите запись с микрофона, загрузите в Palatine Speech и заберите готовый текст с тайм-кодами и разметкой по спикерам. Обработка займёт 1–2% от длительности файла.
Сколько стоит транскрибация интервью?
От 0,29 ₽/мин, оплата pay-as-you-go. Часовое интервью выходит примерно в 17 ₽, секунды округляются вниз, подписки нет, баланс не сгорает.
Есть ли бесплатный способ расшифровать интервью?
Да, Telegram-бот @VoicePalatineBot: до 100 транскрибаций в день. Перешлите ему голосовое или аудиофайл и получите текст в ответ. Под серию из двадцати глубинных интервью бот не заточен, там удобнее веб-кабинет или API.
Можно ли загрузить интервью по ссылке с YouTube или VK?
Нет, приём идёт только файлом или записью с микрофона. Если беседа опубликована на видеохостинге, сначала сохраните её файлом, а потом загружайте.
Сервис отличает интервьюера от респондента?
Да, за это отвечает диаризация: запись делится по говорящим, и транскрипт читается как диалог. На фокус-группе с перебиваниями границы реплик плывут, такой текст стоит один раз пройти руками.
Насколько точна расшифровка аудио интервью?
WER 7,10% и WAcc 92,9% на бенчмарке из семи датасетов. Телефонная запись на канале 8 кГц даёт около 90%: узкий канал срезает верхние частоты.
Переводит ли сервис интервью на другой язык?
Нет. Запрос «перевести интервью в текст» означает расшифровку на том же языке, речь превращается в символы. Распознаётся около 100 языков, включая русский и языки СНГ.
В каких форматах выгружается транскрипт интервью?
txt, json, verbose_json, srt и vtt. verbose_json отдаёт сегменты с тайм-кодами, а srt и vtt пригодятся, если у интервью есть видеоверсия и к ней нужны субтитры.
Безопасно ли загружать записи с персональными данными?
Записи обрабатываются в четырёх ЦОД уровня Tier III на территории РФ по 152-ФЗ, соединение шифруется по TLS. На файлах клиентов модели не обучаются.