Как анализировать интервью: от записи до инсайтов

Перетащите аудио или видео или нажмите, чтобы выбратьMP3 · WAV · M4A · OGG · MP4 · до 30 минут
Пример результата – так выглядит готовая расшифровка
00:47РусскийСпикеры: 2
00:00Спикер 1

Давай коротко по срокам. Мы успеваем к пятнице или переносим на следующую неделю?

00:07Спикер 2

К пятнице успеваем, если макеты придут завтра. Если позже, то реалистичнее вторник, и это я ещё не закладываю правки после ревью.

00:18Спикер 1

Понял. Тогда я тереблю дизайн сегодня, а ты пока начинаешь с той части, которая от макетов не зависит.

00:25Спикер 2

Договорились. И ещё момент: на прошлой неделе мы забыли записать решение по интеграции, потом полчаса вспоминали. Давай в этот раз зафиксируем сразу.

AI-саммари

Фрагмент рабочего созвона: обсуждают сроки по задаче и договариваются, кто отвечает за следующий шаг.

Вопрос, как анализировать интервью, встаёт после первой же серии разговоров: на руках несколько часов аудио, а сформулированных выводов нет ни одного. Масштаб считается на пальцах: пять часовых разговоров в бытовом темпе около 120 слов в минуту дают порядка 35 тысяч слов расшифровки, а перепечатать час записи руками стоит четырёх и более часов работы. Дальше выбирают из двух зол, пересказ по памяти или два дня на переслушивание.

Есть третий маршрут из пяти шагов: подготовка, расшифровка, кодирование, паттерны, выводы. В академическом виде это шесть фаз тематического анализа Брауна и Кларк (2006). Маршрут ложится и на глубинное интервью с пользователем, и на custdev интервью с покупателем: изящного в нём мало, зато такой анализ интервью выдерживает вопрос «а откуда вы это взяли».

Зачем анализировать интервью, если всё и так «в голове»

После трёх разговоров исследователь помнит почти всё. Дальше работает кривая забывания Эббингауза (1885): самый резкий провал приходится на первые сутки, и в памяти остаётся эмоциональное, а ровный тон стирается. Поверх ложится эвристика доступности, описанная Тверски и Канеманом в 1973 году: частым кажется то, что легче вспомнить.

Развязка типичная: один респондент со злостью рассказывает, как выгружает всё в Excel, и эта боль выглядит главной; трое спокойных людей до него обронили, что не понимают статус заказа, и не запомнились. В бэклог уходит экспорт, статус всплывает через квартал. Без разметки громкость реплики подменяет распространённость.

Второй мотив это защита выводов: сколько человек сказали то же самое и из каких сегментов. По размеченному материалу ответ собирается за минуту, цитатами с тайм-кодами. Но анализ интервью не чинит плохо проведённый разговор: наводящий вопрос («вам же неудобно искать заказ?») разметка в данные не превратит. Правило Роба Фицпатрика из «The Mom Test» (2013) первично: спрашивать про прошлое поведение и конкретные случаи, а не про будущие намерения.

Подготовка, research question и карточка респондента

До первого прослушивания сформулируйте research question в одну строку. «Изучить пользовательский опыт» не годится, нужна формулировка вроде «почему клиенты сегмента SMB бросают настройку интеграции на втором шаге»: без такой рамки кодировать хочется всё подряд. Тайминг тоже задаётся заранее: глубинное интервью занимает 45–90 минут, пользовательское интервью вокруг одного сценария укладывается в 30–60.

Карточка респондента заводится до интервью и дозаполняется сразу после. Через две недели не вспомнить, кто из двух Алексеев работал в логистике, и нарезать выборку по сегментам не выйдет.

  • Роль и сегмент: «менеджер» это пустая строка, пишите «закупки, до 50 человек».
  • Откуда человек в выборке: пришедшие из поддержки говорят на взводе.
  • Дата, длительность, формат записи и частота дискретизации, если дорожка телефонная.
  • Гипотеза, которую проверяли: custdev по Стиву Бланку (2005) проверяет догадку о проблеме, а не мнение о будущей функции.
  • Строка «что удивило», заполненная в первый час после разговора.

Последняя строка самая ценная и чаще всего пустая: через день впечатление уже причёсано под ожидания.

Расшифровка, чтобы получить текст, по которому можно искать

Нужен текст с тайм-кодами и делением на спикеров: без диаризации через неделю не понять, интервьюер подсказал формулировку или респондент дал её сам. Zoom при локальной записи кладёт рядом с видео аудиодорожку m4a с кодеком AAC, Google Meet сохраняет встречу на Google Диск в mp4.

Телефонная линия ограничена полосой примерно 300–3400 Гц при частоте дискретизации 8 кГц, поэтому глухие согласные («с» и «ф», «п» и «т») путает даже человек, а для распознавания предпочтительны 16 кГц и выше. Час несжатого wav PCM 16 кГц, 16 бит, моно занимает около 115 МБ, тот же час в mp3 64 кбит/с моно весит меньше 30 МБ. Если платформа умеет писать каждого участника отдельной дорожкой, включайте.

Palatine Speech отдаёт текст с тайм-кодами и разделением по спикерам: WAcc 92,9% и WER 7,10% на бенчмарке из семи датасетов, обработка занимает 1–2% длительности файла, то есть часовой разговор становится текстом примерно за минуту. Запись нужно скачать файлом (mp3, wav, m4a, ogg, aac) и загрузить в транскрибация аудио в текст: приёма по ссылке нет, очный разговор можно писать с микрофона. Одно-два интервью в месяц закрываются бесплатно через Telegram-бот для расшифровки голосовых @VoicePalatineBot, до 100 транскрибаций в день.

На именах, аббревиатурах и жаргоне модель ошибается, поэтому заведите глоссарий терминов проекта. Текст выдаётся на языке речи, кросс-языкового перевода нет: интервью на казахском останется казахским. И решите, какой текст нужен: verbatim со всеми «эээ» и повторами идёт на анализ речи и в суд, для кодирования смыслов берите вычищенный вариант.

Кодирование, или как размечать ответы вместо пересказа

Код это короткая метка смысла, привязанная к цитате и тайм-коду. Строка разметки состоит из пяти полей, например: 00:12:40, Р3 из закупок в SMB, «я просто выгружаю в Excel и считаю руками», код «выгрузка в Excel», тип «обходной путь». Джонни Салданья делит работу на два цикла: первый ставит метки на цитаты, второй сводит их в паттерн-коды (термин Майлза и Хубермана).

Способ кодированияКогда подходитГде ломаетсяЧто на выходе
Открытое, индуктивноетема новая, гипотез нетдесятки синонимов, сведение стоит днячерновой список кодов
По заданной схеме, дедуктивноесерия по одной гипотезе, кодировщиков нескольконе видит того, чего в схеме нетсравнимые срезы по сегментам
In vivo, кодом идёт дословная фразанужен язык клиента для текстов и интерфейсакоды не обобщаютсясловарь формулировок клиента
Процессное, метка действием («жду подтверждения»)восстановить шаги и место обрыване годится для эмоций и оценоккарта сценария с точками отказа

Второй цикл сводит синонимы в кодировочную таблицу, она же кодировочная книга. Структура записи проверена у Маккуин с коллегами (1998): название, краткое определение, полное определение, когда применять, когда не применять, пример цитаты. Если размечают двое, согласие считают каппой Коэна по шкале Ландиса и Коха (1977): 0,61–0,80 это существенное согласие, ниже 0,41 наборы несравнимы и коды надо переопределять.

Анализ custdev интервью ломается именно здесь: коды подгоняются под гипотезу, и противоречащее ей в разметку не попадает. Склонность искать подтверждения, а не опровержения, Питер Уэйсон показал ещё в 1960 году. Заводите отдельный код «против гипотезы». Бывает, что он собирает больше цитат, чем основная линия.

Паттерны и инсайты из интервью, чем вывод отличается от красивой цитаты

Паттерн считается по респондентам, упоминания не считаются совсем. Разговорчивый человек даёт восемь реплик про одну боль, а при пересчёте по людям её назвал он один. Процентов на малых выборках лучше не выводить: на девяти респондентах один человек весит 11 процентных пунктов, поэтому «шесть человек из девяти» честнее, чем «67% пользователей».

Интервью в одном сегментеЧто уже можно утверждатьГде ломаетсяЧто на выходе
1–3язык клиента, правки гайдалюбое обобщение и любая частотавопросы на следующие разговоры
4–6основные повторяющиеся темыкраевые сценарии не виднычерновая схема кодов
7–12новые коды почти не появляютсявторой сегмент сюда не подшитьприоритеты с частотами по людям
Больше 12 или новый сегментразличия сегментовразметка отстаёт от записейсравнение сегментов и решение

Понятие насыщения ввели Глейзер и Штраусс в 1967 году, а измерили Гест, Банс и Джонсон в 2006-м: на 60 интервью базовые темы проявились в первых шести. Правило «пяти пользователей» Нильсена и Ландауэра (1993) сюда не переносится: пятеро ловят большинство проблем интерфейса в юзабилити-тесте, но о распространённости мнений не говорят ничего.

Дальше ищите противоречия, там и прячутся инсайты из интервью. Респондент говорит, что пользуется отчётом еженедельно, а на просьбе описать последний случай выясняется, что он был несколько месяцев назад.

Инсайт кроме наблюдения держит контекст и следствие. «Пользователям неудобен статус заказа» звучит как отчёт. Рабочая формулировка иначе: клиенты сегмента SMB звонят менеджеру, потому что статус «в обработке» не различает оплату и сборку. Черновик сводки собирается быстрее через саммари из видео и аудио.

Инструменты, минимальный набор и где он врёт

Специализированный софт на первых проектах не нужен: хватает расшифровки и таблицы с кодами. Доска для стикеров окупается, когда кодов больше тридцати. Плеер нужен с горячими клавишами на скорость: спорный фрагмент разбирают на 0,75, знакомый пролистывают на 1,5.

Языковые модели склеивают двух респондентов в одного и выдают фразу, которой в записи не звучало, поэтому инсайты из интервью от модели сверяйте с тайм-кодом. Текстовый поиск не находит синонимы: запрос «дорого» пропустит «не укладываемся в бюджет». Диаризация путается при наложении речи и на коротких репликах вроде «да, да, понял».

Начать проще всего с одной записи. Возьмите последнее глубинное интервью, расшифруйте с тайм-кодами, разметьте первые десять цитат и посчитайте коды по респондентам. Чаще всего вскрывается одно и то же: половина цитат ложится под один код, а выборка отвечает не на тот вопрос, что заявлен в research question. Узнать это на одном интервью дешевле, чем на девяти.