Транскрибация для исследователей
Расшифровка глубинных интервью и фокус-групп для исследователей: точность WER 7,10%, деление по спикерам, тайм-коды, дословные транскрипты для кодирования. От 0,29 ₽/мин, данные в РФ (152-ФЗ).
- Глубинные интервью и фокус-группы
- Транскрипты для кодирования
- WAcc 92,9% (WER 7,10%)
- ~100 языков
- от 0,29 ₽/мин
Собрали десяток глубинных интервью, а впереди кодирование и анализ. Транскрибация для исследователей переводит эти записи в дословный текст: мы распознаём речь с точностью WER 7,10% и раскладываем реплики по спикерам. Часовое интервью становится транскриптом примерно за минуту, а не за смену ручной расшифровки.
И это транскрипт, с которым сразу работают. Мы ставим тайм-код к каждой реплике и помечаем говорящих, поэтому цитату респондента вы находите за секунды и вставляете в отчёт дословно. Язык записи не меняется: сказали по-русски – получите русский текст, а распознаём мы около 100 языков, включая языки СНГ.
Что даёт транскрибация исследователю
Транскрибация для исследователя – это дословная расшифровка речи под качественное исследование: глубинные интервью, экспертные беседы и фокус-группы мы превращаем в редактируемый транскрипт. В отличие от пересказа или саммари, здесь сохраняется каждая формулировка респондента, а её можно кодировать и цитировать.
Работаем с любой записью, где есть звук. Диктофон, телефон, сохранённая видеовстреча, микрофон в браузере – мы одинаково расшифровываем и файл, и живую диктовку. Из видеозаписи берётся звуковая дорожка, поэтому формат исходника роли не играет: значение имеют разборчивость речи и уровень шума.
Телефонные и удалённые интервью мы обрабатываем моделью под телефонию. На узком канале 8 кГц, где универсальные движки проседают, точность держится около 90%, поэтому запись беседы по телефону тоже превращается в пригодный для кодирования транскрипт, а не в набор оговорок.
Глубинные интервью: спикеры и дословность
Расшифровка глубинных интервью нужна с разметкой, кто говорит. Диаризация делит запись на реплики интервьюера и респондента и ставит тайм-код к каждой, поэтому в транскрипте сразу видно структуру разговора. Не приходится вручную помечать, где вопрос, а где ответ.
Дословность здесь важнее, чем в новостной заметке. Для кодирования и цитирования нужна точная формулировка, а не близкий по смыслу пересказ, и точность WER 7,10% это обеспечивает. Если из интервью нужны только тезисы, соберите саммари из аудио, но исходный дословный транскрипт остаётся у вас для анализа.
Исследователю нужен не пересказ, а дословный транскрипт с разметкой, кто что сказал: только по нему можно точно цитировать респондента и кодировать реплики. Поэтому мы раскладываем запись по говорящим и ставим тайм-коды, а серию из десятка часовых интервью расшифровываем за минуты, а не за неделю.
Фокус-группы: несколько респондентов
Расшифровка фокус-групп сложнее интервью один на один: говорят модератор и несколько участников, реплики накладываются. Мы раскладываем такую запись по спикерам, поэтому голоса респондентов не сливаются в сплошную стену текста. Даже на дискуссии в полтора-два часа видно, кому принадлежит конкретная реплика.
Дальше работает поиск по транскрипту и тайм-коды. Нужен фрагмент про одну тему из длинной групповой записи – находите его по слову за пару секунд. Для UX-исследований это удобно: реплики про конкретный сценарий собираются в один проход, а не переслушиванием всей сессии.

Транскрипты для кодирования и анализа
Транскрибация для исследования отличается тем, что текст потом кодируют. Мы отдаём транскрипт в txt, json и verbose_json: последний формат содержит пословные тайм-коды и разметку спикеров, поэтому его удобно грузить в инструменты качественного анализа и размечать реплики темами. Тайм-коды сохраняются во всех форматах.
Кодирование остаётся вашей методологией, мы закрываем этап до него. За аналитикой и выводами по кластеру интервью загляните в расшифровку интервью как тематический хаб, а здесь задача одна: превратить серию записей в чистые дословные транскрипты, готовые к разметке.
Пословные тайм-коды в verbose_json помогают на сверке. Спорную формулировку из транскрипта вы открываете в записи по времени и слушаете исходный фрагмент, а не переслушиваете часовое интервью целиком. При межисследовательской проверке кодировки это экономит часы на серии из десяти и более записей.

Точность и скорость на сериях интервью
Качественное исследование – это не один файл, а серия, и тут решают точность и скорость сразу. Точность распознавания у нас WER 7,10% и WAcc 92,9% по бенчмарку на 7 датасетах, так что транскрипт пригоден для кодирования почти без вычитки. Ниже – сравнение по WER с другими движками.
Скорость измеримая: обработка идёт за 1–2% от длительности файла. Десяток часовых интервью превращается в транскрипты за минуты, а не за неделю. Таблица подсказывает, что под какой тип записи получаете на выходе.
| Тип записи | Когда подходит | Что на выходе |
|---|---|---|
| Глубинное интервью (диктофон, mp3) | Один на один, экспертная беседа | Транскрипт со спикерами и тайм-кодами |
| Фокус-группа (видео, mp4) | Групповая дискуссия, несколько респондентов | Транскрипт с делением по говорящим |
| Серия файлов | Пакет интервью под кодирование | verbose_json с пословными тайм-кодами |

Хранение данных и согласие респондентов
Записи исследования содержат персональные данные участников, поэтому хранение важно не меньше точности. Материалы обрабатываются и хранятся в 4 ЦОД уровня Tier III на территории РФ по 152-ФЗ, соединение защищено TLS. На данных клиентов модели не обучаются, так что записи респондентов не попадают в обучающую выборку.
Контроль над данными остаётся у команды. Готовые транскрипты вы выгружаете себе и удаляете из сервиса, а хранение в РФ упрощает работу с согласиями участников на обработку персональных данных. Это же снимает вопрос трансграничной передачи: записи не покидают периметр 152-ФЗ и не уходят на зарубежные серверы.
Сколько стоит и API для команды
Расшифровка тарифицируется от 0,29 ₽/мин по модели pay-as-you-go: вы платите только за обработанные минуты, баланс не сгорает, секунды округляются вниз. Серия из десятка интервью обходится в считанные рубли, отдельная подписка не нужна.
Для команды есть API. Распознавание подключается через OpenAI-совместимый эндпоинт (POST /audio/transcriptions) для файлов и потока по WebSocket, а короткие записи можно быстро прогнать через Telegram-бот @VoicePalatineBot – до 100 транскрибаций в день без регистрации. Так пилотный проект собирают на боте, а полевой этап на сотни записей уводят в API и обрабатывают пакетом.
Ответы на вопросы
Не нашли ответ на свой вопрос? Напишите нам
Как расшифровать интервью для исследования?
Загрузите запись с диктофона, телефона или сохранённый звонок файлом, запустите распознавание и заберите дословный транскрипт. Обработка занимает около 1–2% от длительности записи, поэтому часовое интервью готово примерно за минуту.
Разложит ли сервис фокус-группу по спикерам?
Да. Диаризация делит реплики по говорящим и ставит тайм-код к каждой, так что видно, где модератор, а где отдельные респонденты. Даже на групповой дискуссии на полтора-два часа реплики не смешиваются в сплошной текст.
В каких форматах транскрипт для кодирования?
Доступны txt, json, verbose_json, srt и vtt. Формат verbose_json содержит пословные тайм-коды и разметку спикеров, поэтому его удобно грузить в инструменты качественного анализа и кодировать реплики.
Насколько точная расшифровка?
Точность распознавания – WER 7,10% и WAcc 92,9% по бенчмарку на 7 датасетах. Для сравнения, Whisper-large-v3 показывает WER 7,44%. Дословный текст можно цитировать в отчёте почти без правки.
Можно ли расшифровать запись Zoom по ссылке?
Приёма по ссылке нет: сохраните запись встречи и загрузите её файлом. Из видеофайла сервис возьмёт звуковую дорожку и расшифрует так же, как обычную запись.
Как быстро расшифровать серию интервью?
Каждый файл обрабатывается за 1–2% от своей длительности, поэтому десяток часовых интервью превращается в транскрипты за минуты, а не за неделю ручной расшифровки.
Безопасно ли для данных респондентов?
Записи обрабатываются и хранятся в 4 ЦОД уровня Tier III на территории РФ по 152-ФЗ, соединение защищено TLS. На данных клиентов модели не обучаются, что важно при работе с персональными данными участников.
Есть ли API для команды?
Да. Распознавание подключается через OpenAI-совместимый API (POST /audio/transcriptions) – и для готовых файлов, и для потока по WebSocket. Документация на docs.speech.palatine.ru.