Транскрибация для маркетологов: фокус-группы и интервью

Перетащите аудио или видео или нажмите, чтобы выбратьMP3 · WAV · M4A · OGG · MP4 · до 30 минут
Пример результата – так выглядит готовая расшифровка
00:47РусскийСпикеры: 2
00:00Спикер 1

Давай коротко по срокам. Мы успеваем к пятнице или переносим на следующую неделю?

00:07Спикер 2

К пятнице успеваем, если макеты придут завтра. Если позже, то реалистичнее вторник, и это я ещё не закладываю правки после ревью.

00:18Спикер 1

Понял. Тогда я тереблю дизайн сегодня, а ты пока начинаешь с той части, которая от макетов не зависит.

00:25Спикер 2

Договорились. И ещё момент: на прошлой неделе мы забыли записать решение по интеграции, потом полчаса вспоминали. Давай в этот раз зафиксируем сразу.

AI-саммари

Фрагмент рабочего созвона: обсуждают сроки по задаче и договариваются, кто отвечает за следующий шаг.

Транскрибация для маркетологов сводится у меня к одной фразе, которую клиент говорит один раз. На фокус-группе или в звонке менеджеру. Своими словами. А через неделю в моём отчёте от неё оставалась строчка языком брифа.

Я считал это нормальной потерей. Пока в феврале не сверил свой отчёт с расшифровкой той группы. Ключевое слово участница сказала на двадцать восьмой минуте, я его не услышал и подставил синоним. Расшифровка для маркетинга стоит ровно столько, сколько стоит эта фраза. У вас правда иначе?

Где маркетологу нужна расшифровка

Первый свой вебинар я расшифровал целиком, полтора часа ради зацепок для лендинга. Пригодились последние пятнадцать минут с вопросами зала. Остальное было моим же текстом вслух.

Транскрибация для маркетологов окупается там, где говорит клиент. Планёрку отдела я в текст перевожу тоже, но чужих формулировок в ней ноль. Глубинное интервью на сорок минут беру целиком. А восьмиминутный звонок в продажи ценен двумя фразами.

Источник речиДлинаЧто достаютПодвох
Фокус-группа60–120 минРеакции на концептШесть-восемь голосов, перебивки
Глубинное интервью, custdev40–60 минЯзык клиента, история выбораРади него всё и затевается
Звонок в продажи5–15 минВозражения дословноКанал 8 кГц, точность около 90%
Ушедший клиент20–40 минПричина отказаЛюди смягчают

Почему расшифровка фокус-групп сложнее всего

Расшифровка фокус-групп ломается там, где интервью один на один идёт гладко. В комнате шесть-восемь человек, они перебивают друг друга. Диаризация (деление на спикеров) держится, пока говорят по очереди, и сшивает двоих в одного на длинном наложении. В мартовской группе так слиплись две участницы, и я полчаса разбирался, кто хвалил упаковку.

Качество текста я закладываю до записи. Что я делаю за пять минут до старта?

  • один микрофон в центр стола (мой первый диктофон лежал в кармане, половина группы ушла в фон);
  • круг знакомства с именами. Реплики придут «Спикером 1» и «Спикером 2», сопоставлю по этой минуте;
  • новый блок проговариваю вслух, иначе в сорока страницах текста не за что зацепиться;
  • спорят дольше минуты? Называю говорящего по имени, метка останется в расшифровке.

Полуторачасовую группу мы обрабатываем за полторы минуты, около 26 рублей при тарифе от 0,29 ₽/мин.

Но текст не заменяет наблюдение. Кто промолчал весь час? Кто кивал мне, а в анкете поставил низшую оценку? Этого в расшифровке нет, заметки модератора я пишу руками.

Интервью с клиентами и звонки, где лежит язык покупателя

Расшифровка интервью с клиентами даёт мне голос клиента в исходном порядке слов. Клиент не говорит «омниканальная платформа». Он говорит «чтобы всё было в одном окне и не надо было переспрашивать». Такие места я ищу поиском по подстроке, а транскрибация интервью с диаризацией отделяет реплики респондента от моих подсказок. Часть красивых цитат в ранних custdev-отчётах подсказал я сам. Увидел я это через год.

Звонки работают иначе. В интервью человек тратит моё время, в звонке своё, и возражения звучат резче. Тридцать звонков по восемь минут дают 240 минут аудио, около 70 рублей против трёх часов прослушивания на 1,5x. Поэтому транскрибация звонков и аудит звонков окупаются у меня быстрее всего.

А если дорожка звучит плохо? Канал 8 кГц мы распознаём с точностью около 90%, названия брендов и тарифов я сверяю глазами. Раздражало ровно до первой попытки разобрать их на слух.

Как из речи получаются инсайты для маркетинга

Сама по себе расшифровка даёт папку с файлами. У меня такая лежит с позапрошлого проекта, я не открывал её ни разу.

Мой маршрут на десять записей занимает час. Я ищу по опорным словам категории («дорог», «сравнива», «не понял», имена конкурентов), выписываю цитату с тайм-кодом в таблицу, считаю частотность по людям. Тут расшифровка для маркетинга превращается в работу. Один разговорчивый участник даёт восемь упоминаний одной боли и выглядит в сводке большинством. Я на нём построил целый слайд.

Куда пойдут формулировки, решаю заранее. Иначе таблица станет архивом.

  • заголовок лендинга. Беру фразу, которой клиент описал результат;
  • блок возражений и FAQ. Пять вопросов из звонков слово в слово (про цену тоже);
  • бриф на креатив и UGC-сценарий. Цитата с тайм-кодом даёт актёру интонацию;
  • скрипт продаж. У менеджеров есть удачные ответы, которых нет в документах;
  • семантика. Словарь категории у клиентов расходится с языком отраслевых статей.

Где метод врёт? Частотность не равна инсайту, «удобно» встретится в каждом втором интервью. Восемь разговоров не дают процентов, «шесть человек из девяти» честнее. Текст не передаёт сарказм (одну цитату я не переслушал, и на защите выяснилось, что сказали её с усмешкой).

Как расшифровать свои записи

Транскрибация для маркетологов технически не отличается от расшифровки совещания. Мы принимаем файл или запись с микрофона, а ссылку на вебинар вставить не получится. Файл я выгружаю руками из Zoom, из телефонии, с диктофона (mp3, wav, m4a, ogg, aac подойдут). Формат беру по тому, куда текст поедет. txt глазами, verbose_json для базы цитат, srt или vtt для субтитров.

Файл мы обрабатываем за 1–2% его длительности. Получасовое интервью я забираю через 25 секунд, часовое через минуту. На 30-минутном файле Yandex SpeechKit тратит около 2 минут, OpenAI около 10. Точность мы мерили на бенчмарке из семи датасетов, WER 7,10%, WAcc 92,9%. У ElevenLabs 6,88%, у AssemblyAI 7,03%, у Whisper-large-v3 7,44%.

Тариф от 0,29 ₽/мин, подписки у нас нет, секунды округляем вниз, баланс между исследованиями не сгорает (в марте у меня четыре группы, в апреле ни одной). Хотите попробовать? Есть транскрибация бесплатно через Telegram-бот @VoicePalatineBot, до 100 транскрибаций в день.

Юристы спросят про данные. Мы работаем по 152-ФЗ, держим данные в России в четырёх ЦОД уровня Tier III, шифруем передачу по TLS, на записях клиентов модели не обучаем. А языки? Их около сотни, включая языки СНГ, но расшифровку мы отдаём на языке речи. Группа в Алматы вернулась казахским текстом, перевода мы не делаем. API по файлам и поток по WebSocket, документация на docs.speech.palatine.ru. Вебхуков нет, статус задачи я опрашиваю сам.

И начните с одной записи. Возьмите последнюю фокус-группу или три звонка, выпишите десять фраз, которыми клиенты назвали свою проблему, и положите рядом с заголовком лендинга. У меня не совпало ни одного слова. Заголовок я переписал в тот же вечер.