Как анализировать интервью: от записи до инсайтов

Перетащите аудио или видео или нажмите, чтобы выбратьMP3 · WAV · M4A · OGG · MP4 · до 30 минут
Пример результата – так выглядит готовая расшифровка
00:47РусскийСпикеры: 2
00:00Спикер 1

Давай коротко по срокам. Мы успеваем к пятнице или переносим на следующую неделю?

00:07Спикер 2

К пятнице успеваем, если макеты придут завтра. Если позже, то реалистичнее вторник, и это я ещё не закладываю правки после ревью.

00:18Спикер 1

Понял. Тогда я тереблю дизайн сегодня, а ты пока начинаешь с той части, которая от макетов не зависит.

00:25Спикер 2

Договорились. И ещё момент: на прошлой неделе мы забыли записать решение по интеграции, потом полчаса вспоминали. Давай в этот раз зафиксируем сразу.

AI-саммари

Фрагмент рабочего созвона: обсуждают сроки по задаче и договариваются, кто отвечает за следующий шаг.

Я спросил себя, как анализировать интервью, на седьмой записи. Продакт написал в чате «что мы поняли?», а у меня шесть часов аудио и ноль выводов. Знакомо?

Дальше выбор из двух зол. Пересказ по памяти или два дня на переслушивание. Мой маршрут другой. Подготовка, расшифровка, кодирование, паттерны, выводы. Он ложится и на глубинное интервью с пользователем, и на custdev интервью с покупателем. Изящного мало, зато такой анализ интервью выдерживает вопрос «а откуда вы это взяли».

Зачем анализировать интервью, если всё и так «в голове»

После трёх разговоров вы помните почти всё. А после девяти? Память оставляет вам эмоциональное и стирает то, что повторялось у всех.

Один респондент со злостью рассказывал, как выгружает всё в Excel. Я решил, что нашёл главную боль. А три спокойных человека до него обронили, что не понимают статус заказа. В бэклог ушёл экспорт, статус всплыл через квартал. Глубинное интервью, custdev интервью, разницы нет.

Второй мотив это защита. Сколько человек это сказали и из какого сегмента? Размеченный материал даёт нам шесть цитат с тайм-кодами за минуту. Но анализ интервью не чинит плохо проведённый разговор, наводящий вопрос («вам же неудобно искать заказ?») разметка в данные не превратит. Сначала научитесь вести разговор, потом разбирайтесь, как анализировать интервью.

Готовимся заранее, пишем research question и карточку респондента

До первого прослушивания сформулируйте research question в одну строку. «Изучить пользовательский опыт» не годится, возьмите «почему клиенты сегмента SMB бросают настройку интеграции на втором шаге». Иначе вы закодируете всё подряд. Каждый код объясняете через этот вопрос.

Карточку респондента мы заводим до интервью и дозаполняем сразу после. Заполнять её лень всегда. Но через две недели вы не вспомните, кто из двух Алексеев был из логистики, и по сегментам не нарежете.

  • Роль и сегмент. «Менеджер» это пустая строка, пишите «закупки, до 50 человек».
  • Откуда человек в выборке. Из поддержки к нам приходят на взводе.
  • Дата, длительность и формат записи.
  • Гипотеза, которую мы на нём проверяли.
  • Строка «что удивило» в первый час после разговора.

Последняя строка самая ценная и всегда пустая. Удивление живёт часа полтора. Успеете? Карточка нужна одинаково, будь то глубинное интервью на час или пользовательское интервью на двадцать минут.

Расшифровка, чтобы получить текст, по которому можно искать

Переслушивать шесть часов аудио никто не станет. Нам нужен текст с тайм-кодами и делением на спикеров. Без диаризации вы через неделю не поймёте, кто произнёс ключевую фразу. Вы подсказали или он сам?

Теперь цифры. Palatine Speech показывает WER 7,10% и WAcc 92,9% на бенчмарке из семи датасетов и обрабатывает файл за 1–2% его длительности. Получасовое интервью мы превращаем в текст за 25 секунд, часовое за минуту. Тот же файл Yandex SpeechKit считает около 2 минут, OpenAI около 10.

Запись из Zoom, Meet или диктофона вы скачиваете файлом (mp3, wav, m4a, ogg, aac) и грузите в транскрибация аудио в текст. Приёма по ссылке у нас нет. Зато вы пишете с микрофона, если разговор очный. Результат забираете в txt для глаз, в verbose_json для скрипта, в srt или vtt для видео. Тариф от 0,29 ₽/мин без подписки, секунды мы округляем вниз. Одно-два custdev интервью в месяц вы закроете бесплатно, Telegram-бот для расшифровки голосовых @VoicePalatineBot обрабатывает до 100 транскрибаций в день.

А если запись шумная? Мы спотыкаемся на именах и жаргоне, термины проверяйте руками. Телефонная дорожка на канале 8 кГц распознаётся с точностью около 90%. Текст мы выдаём на языке речи, перевода на другой язык нет, интервью на казахском останется казахским (языков около 100, включая языки СНГ). И про хранение. Четыре ЦОД Tier III в РФ по 152-ФЗ, на ваших записях мы модели не обучаем.

Кодирование, или как мы размечаем ответы вместо пересказа

Код это короткая метка смысла, привязанная к цитате и тайм-коду. Первый проход открытый, метки ставите как придётся. Наберётся сорок штук, половина синонимы. Ведём это в таблице, по строке на цитату.

Тайм-кодРеспондент, сегментЦитатаКодТип
00:12:40Р3, закупки, SMB«Я просто выгружаю в Excel и считаю руками»выгрузка в Excelобходной путь
00:27:05Р5, ритейл«Статус висит „в обработке“, звоню менеджеру»непрозрачный статусболь
00:41:18Р5, ритейл«Настройку делал не я, а подрядчик»делегированиеконтекст

Сорок кодов, и что дальше? Второй проход сводит синонимы в кодировочную таблицу, «считаю в экселе» и «своя табличка» становятся одним кодом. Иначе вы с коллегой будете спорить, что считать обходным путём.

Анализ custdev интервью ломается именно здесь. Узнаёте? Мы подгоняем коды под гипотезу, и противоречащее в разметку не попадает. Заводите код «против гипотезы» и складывайте туда неудобное. У меня он однажды собрал больше цитат, чем основная линия. Весь анализ интервью держится на этом.

Паттерны и инсайты из интервью, чем вывод отличается от красивой цитаты

Паттерн мы считаем по респондентам, упоминания не считаем совсем. Один разговорчивый человек даёт восемь реплик про одну боль, и она выглядит главной. Пересчитайте по людям, и боль окажется одна на всю выборку. Процентов на малых выборках мы не выводим, «шесть человек из девяти» честнее, чем «67% пользователей».

Дальше ищите противоречия, там и прячутся инсайты из интервью. Респондент говорит, что пользуется отчётом еженедельно. Просишь описать последний раз, и он вспоминает март. Видите расхождение? Пользовательское интервью подкидывает нам такое постоянно.

Инсайт кроме наблюдения держит контекст и следствие для продукта. «Пользователям неудобен статус заказа» звучит как отчёт, делать по нему нечего. А так мы работаем. Клиенты сегмента SMB звонят менеджеру, потому что статус «в обработке» не различает оплату и сборку, и подсказка в UI это не закроет. Черновик сводки вы соберёте быстрее через саммари из видео и аудио, но каждую цитату сверяйте с тайм-кодом. Анализ custdev интервью тут либо даёт решение, либо остаётся пересказом.

Инструменты, минимальный набор и где он врёт

Специализированный софт на первых проектах не нужен. Хватает расшифровки и таблицы с кодами. Доска для стикеров нужна, когда кодов больше тридцати. А если интервью идут потоком и расшифровки нужны в вашей базе? У нас есть API для файлов и поток по WebSocket, документация на docs.speech.palatine.ru. Вебхуков нет, статус задачи вы опрашиваете сами.

Где инструменты врут? Языковые модели склеивают двух респондентов в одного и выдают фразу, которой в записи не звучало. Инсайты из интервью от модели я сверяю с тайм-кодом. Текстовый поиск не найдёт синоним, «дорого» пропустит «не укладываемся в бюджет». Диаризация путается, когда говорят одновременно, спорные места переслушайте ушами.

С чего начать? Возьмите последнее глубинное интервью, расшифруйте его с тайм-кодами, разметьте первые десять цитат и посчитайте по респондентам. У меня тут вылезает одно и то же. Половина цитат под одним кодом, а выборка отвечает на соседний вопрос.