Перетащите запись интервью или нажмите, чтобы выбратьMP3 · WAV · M4A · OGG · MP4 · до 30 минут
Пример результата – так выглядит готовая расшифровка
00:42РусскийСпикеры: 2
00:00Спикер 1

Расскажите, как вы сейчас разбираете записи после интервью?

00:05Спикер 2

Раньше отсматривала вручную, уходил весь вечер. Сейчас загружаю файл и через минуту читаю текст с тайм-кодами.

00:15Спикер 1

А что с несколькими собеседниками, их видно отдельно?

00:23Спикер 2

Да, реплики разведены по говорящим. На фокус-группе с перебиваниями приходится немного править руками.

AI-саммари

Фрагмент интервью: исследователь спрашивает про выбор инструмента, респондент отвечает.

Транскрибация для исследователей

Расшифровка глубинных интервью и фокус-групп для исследователей: точность WER 7,10%, деление по спикерам, тайм-коды, дословные транскрипты для кодирования. От 0,29 ₽/мин, данные в РФ (152-ФЗ).

  • Глубинные интервью и фокус-группы
  • Транскрипты для кодирования
  • WAcc 92,9% (WER 7,10%)
  • ~100 языков
  • от 0,29 ₽/мин

Собрали десяток глубинных интервью, а впереди кодирование и анализ. Транскрибация для исследователей переводит эти записи в дословный текст: мы распознаём речь с точностью WER 7,10% и раскладываем реплики по спикерам. Часовое интервью становится транскриптом примерно за минуту, а не за смену ручной расшифровки.

И это транскрипт, с которым сразу работают. Мы ставим тайм-код к каждой реплике и помечаем говорящих, поэтому цитату респондента вы находите за секунды и вставляете в отчёт дословно. Язык записи не меняется: сказали по-русски – получите русский текст, а распознаём мы около 100 языков, включая языки СНГ.

Что даёт транскрибация исследователю

Транскрибация для исследователя – это дословная расшифровка речи под качественное исследование: глубинные интервью, экспертные беседы и фокус-группы мы превращаем в редактируемый транскрипт. В отличие от пересказа или саммари, здесь сохраняется каждая формулировка респондента, а её можно кодировать и цитировать.

Работаем с любой записью, где есть звук. Диктофон, телефон, сохранённая видеовстреча, микрофон в браузере – мы одинаково расшифровываем и файл, и живую диктовку. Из видеозаписи берётся звуковая дорожка, поэтому формат исходника роли не играет: значение имеют разборчивость речи и уровень шума.

Телефонные и удалённые интервью мы обрабатываем моделью под телефонию. На узком канале 8 кГц, где универсальные движки проседают, точность держится около 90%, поэтому запись беседы по телефону тоже превращается в пригодный для кодирования транскрипт, а не в набор оговорок.

Глубинные интервью: спикеры и дословность

Расшифровка глубинных интервью нужна с разметкой, кто говорит. Диаризация делит запись на реплики интервьюера и респондента и ставит тайм-код к каждой, поэтому в транскрипте сразу видно структуру разговора. Не приходится вручную помечать, где вопрос, а где ответ.

Дословность здесь важнее, чем в новостной заметке. Для кодирования и цитирования нужна точная формулировка, а не близкий по смыслу пересказ, и точность WER 7,10% это обеспечивает. Если из интервью нужны только тезисы, соберите саммари из аудио, но исходный дословный транскрипт остаётся у вас для анализа.

Комментарий Palatine Speech
Исследователю нужен не пересказ, а дословный транскрипт с разметкой, кто что сказал: только по нему можно точно цитировать респондента и кодировать реплики. Поэтому мы раскладываем запись по говорящим и ставим тайм-коды, а серию из десятка часовых интервью расшифровываем за минуты, а не за неделю.
Валерий ГречинCEO Palatine Speech

Фокус-группы: несколько респондентов

Расшифровка фокус-групп сложнее интервью один на один: говорят модератор и несколько участников, реплики накладываются. Мы раскладываем такую запись по спикерам, поэтому голоса респондентов не сливаются в сплошную стену текста. Даже на дискуссии в полтора-два часа видно, кому принадлежит конкретная реплика.

Дальше работает поиск по транскрипту и тайм-коды. Нужен фрагмент про одну тему из длинной групповой записи – находите его по слову за пару секунд. Для UX-исследований это удобно: реплики про конкретный сценарий собираются в один проход, а не переслушиванием всей сессии.

Что получаете под тип записи: Интервью, фокус-группа и серия файлов

Транскрипты для кодирования и анализа

Транскрибация для исследования отличается тем, что текст потом кодируют. Мы отдаём транскрипт в txt, json и verbose_json: последний формат содержит пословные тайм-коды и разметку спикеров, поэтому его удобно грузить в инструменты качественного анализа и размечать реплики темами. Тайм-коды сохраняются во всех форматах.

Кодирование остаётся вашей методологией, мы закрываем этап до него. За аналитикой и выводами по кластеру интервью загляните в расшифровку интервью как тематический хаб, а здесь задача одна: превратить серию записей в чистые дословные транскрипты, готовые к разметке.

Пословные тайм-коды в verbose_json помогают на сверке. Спорную формулировку из транскрипта вы открываете в записи по времени и слушаете исходный фрагмент, а не переслушиваете часовое интервью целиком. При межисследовательской проверке кодировки это экономит часы на серии из десяти и более записей.

От записи до транскрипта под кодирование: Как исследователь получает дословный текст

Точность и скорость на сериях интервью

Качественное исследование – это не один файл, а серия, и тут решают точность и скорость сразу. Точность распознавания у нас WER 7,10% и WAcc 92,9% по бенчмарку на 7 датасетах, так что транскрипт пригоден для кодирования почти без вычитки. Ниже – сравнение по WER с другими движками.

Скорость измеримая: обработка идёт за 1–2% от длительности файла. Десяток часовых интервью превращается в транскрипты за минуты, а не за неделю. Таблица подсказывает, что под какой тип записи получаете на выходе.

Тип записиКогда подходитЧто на выходе
Глубинное интервью (диктофон, mp3)Один на один, экспертная беседаТранскрипт со спикерами и тайм-кодами
Фокус-группа (видео, mp4)Групповая дискуссия, несколько респондентовТранскрипт с делением по говорящим
Серия файловПакет интервью под кодированиеverbose_json с пословными тайм-кодами

Транскрибация для исследователей в цифрах: Точность, языки, цена и скорость для качественных исследований

Хранение данных и согласие респондентов

Записи исследования содержат персональные данные участников, поэтому хранение важно не меньше точности. Материалы обрабатываются и хранятся в 4 ЦОД уровня Tier III на территории РФ по 152-ФЗ, соединение защищено TLS. На данных клиентов модели не обучаются, так что записи респондентов не попадают в обучающую выборку.

Контроль над данными остаётся у команды. Готовые транскрипты вы выгружаете себе и удаляете из сервиса, а хранение в РФ упрощает работу с согласиями участников на обработку персональных данных. Это же снимает вопрос трансграничной передачи: записи не покидают периметр 152-ФЗ и не уходят на зарубежные серверы.

Сколько стоит и API для команды

Расшифровка тарифицируется от 0,29 ₽/мин по модели pay-as-you-go: вы платите только за обработанные минуты, баланс не сгорает, секунды округляются вниз. Серия из десятка интервью обходится в считанные рубли, отдельная подписка не нужна.

Для команды есть API. Распознавание подключается через OpenAI-совместимый эндпоинт (POST /audio/transcriptions) для файлов и потока по WebSocket, а короткие записи можно быстро прогнать через Telegram-бот @VoicePalatineBot – до 100 транскрибаций в день без регистрации. Так пилотный проект собирают на боте, а полевой этап на сотни записей уводят в API и обрабатывают пакетом.

Точность распознавания (WER, меньше – лучше)

Palatine SpeechElevenLabsAssemblyAIWhisper-large-v3
WER (бенчмарк на 7 датасетах)7,10%6,88%7,03%7,44%

WER (бенчмарк на 7 датасетах)

Palatine Speech
7,10%
ElevenLabs
6,88%
AssemblyAI
7,03%
Whisper-large-v3
7,44%

Сколько стоит расшифровка

0,29 ₽/мин, pay-as-you-go. Объёмы для бизнеса выделяем по запросу. Баланс не сгорает, секунды округляются вниз.

Длительность аудио600мин · 10 ч
10 мин6 000 мин
✓ Укладывается в 1 000 бесплатных минут – по запросу
Итого за обработку
174
Новым пользователям 1 000 минут бесплатно – выделяем по запросу

Ответы на вопросы

Не нашли ответ на свой вопрос? Напишите нам

Как расшифровать интервью для исследования?

Загрузите запись с диктофона, телефона или сохранённый звонок файлом, запустите распознавание и заберите дословный транскрипт. Обработка занимает около 1–2% от длительности записи, поэтому часовое интервью готово примерно за минуту.

Разложит ли сервис фокус-группу по спикерам?

Да. Диаризация делит реплики по говорящим и ставит тайм-код к каждой, так что видно, где модератор, а где отдельные респонденты. Даже на групповой дискуссии на полтора-два часа реплики не смешиваются в сплошной текст.

В каких форматах транскрипт для кодирования?

Доступны txt, json, verbose_json, srt и vtt. Формат verbose_json содержит пословные тайм-коды и разметку спикеров, поэтому его удобно грузить в инструменты качественного анализа и кодировать реплики.

Насколько точная расшифровка?

Точность распознавания – WER 7,10% и WAcc 92,9% по бенчмарку на 7 датасетах. Для сравнения, Whisper-large-v3 показывает WER 7,44%. Дословный текст можно цитировать в отчёте почти без правки.

Можно ли расшифровать запись Zoom по ссылке?

Приёма по ссылке нет: сохраните запись встречи и загрузите её файлом. Из видеофайла сервис возьмёт звуковую дорожку и расшифрует так же, как обычную запись.

Как быстро расшифровать серию интервью?

Каждый файл обрабатывается за 1–2% от своей длительности, поэтому десяток часовых интервью превращается в транскрипты за минуты, а не за неделю ручной расшифровки.

Безопасно ли для данных респондентов?

Записи обрабатываются и хранятся в 4 ЦОД уровня Tier III на территории РФ по 152-ФЗ, соединение защищено TLS. На данных клиентов модели не обучаются, что важно при работе с персональными данными участников.

Есть ли API для команды?

Да. Распознавание подключается через OpenAI-совместимый API (POST /audio/transcriptions) – и для готовых файлов, и для потока по WebSocket. Документация на docs.speech.palatine.ru.