Вопрос, как анализировать интервью, встаёт после первой же серии разговоров: на руках несколько часов аудио, а сформулированных выводов нет ни одного. Масштаб считается на пальцах: пять часовых разговоров в бытовом темпе около 120 слов в минуту дают порядка 35 тысяч слов расшифровки, а перепечатать час записи руками стоит четырёх и более часов работы. Дальше выбирают из двух зол, пересказ по памяти или два дня на переслушивание.
Есть третий маршрут из пяти шагов: подготовка, расшифровка, кодирование, паттерны, выводы. В академическом виде это шесть фаз тематического анализа Брауна и Кларк (2006). Маршрут ложится и на глубинное интервью с пользователем, и на custdev интервью с покупателем: изящного в нём мало, зато такой анализ интервью выдерживает вопрос «а откуда вы это взяли».
Зачем анализировать интервью, если всё и так «в голове»
После трёх разговоров исследователь помнит почти всё. Дальше работает кривая забывания Эббингауза (1885): самый резкий провал приходится на первые сутки, и в памяти остаётся эмоциональное, а ровный тон стирается. Поверх ложится эвристика доступности, описанная Тверски и Канеманом в 1973 году: частым кажется то, что легче вспомнить.
Развязка типичная: один респондент со злостью рассказывает, как выгружает всё в Excel, и эта боль выглядит главной; трое спокойных людей до него обронили, что не понимают статус заказа, и не запомнились. В бэклог уходит экспорт, статус всплывает через квартал. Без разметки громкость реплики подменяет распространённость.
Второй мотив это защита выводов: сколько человек сказали то же самое и из каких сегментов. По размеченному материалу ответ собирается за минуту, цитатами с тайм-кодами. Но анализ интервью не чинит плохо проведённый разговор: наводящий вопрос («вам же неудобно искать заказ?») разметка в данные не превратит. Правило Роба Фицпатрика из «The Mom Test» (2013) первично: спрашивать про прошлое поведение и конкретные случаи, а не про будущие намерения.
Подготовка, research question и карточка респондента
До первого прослушивания сформулируйте research question в одну строку. «Изучить пользовательский опыт» не годится, нужна формулировка вроде «почему клиенты сегмента SMB бросают настройку интеграции на втором шаге»: без такой рамки кодировать хочется всё подряд. Тайминг тоже задаётся заранее: глубинное интервью занимает 45–90 минут, пользовательское интервью вокруг одного сценария укладывается в 30–60.
Карточка респондента заводится до интервью и дозаполняется сразу после. Через две недели не вспомнить, кто из двух Алексеев работал в логистике, и нарезать выборку по сегментам не выйдет.
- Роль и сегмент: «менеджер» это пустая строка, пишите «закупки, до 50 человек».
- Откуда человек в выборке: пришедшие из поддержки говорят на взводе.
- Дата, длительность, формат записи и частота дискретизации, если дорожка телефонная.
- Гипотеза, которую проверяли: custdev по Стиву Бланку (2005) проверяет догадку о проблеме, а не мнение о будущей функции.
- Строка «что удивило», заполненная в первый час после разговора.
Последняя строка самая ценная и чаще всего пустая: через день впечатление уже причёсано под ожидания.
Расшифровка, чтобы получить текст, по которому можно искать
Нужен текст с тайм-кодами и делением на спикеров: без диаризации через неделю не понять, интервьюер подсказал формулировку или респондент дал её сам. Zoom при локальной записи кладёт рядом с видео аудиодорожку m4a с кодеком AAC, Google Meet сохраняет встречу на Google Диск в mp4.
Телефонная линия ограничена полосой примерно 300–3400 Гц при частоте дискретизации 8 кГц, поэтому глухие согласные («с» и «ф», «п» и «т») путает даже человек, а для распознавания предпочтительны 16 кГц и выше. Час несжатого wav PCM 16 кГц, 16 бит, моно занимает около 115 МБ, тот же час в mp3 64 кбит/с моно весит меньше 30 МБ. Если платформа умеет писать каждого участника отдельной дорожкой, включайте.
Palatine Speech отдаёт текст с тайм-кодами и разделением по спикерам: WAcc 92,9% и WER 7,10% на бенчмарке из семи датасетов, обработка занимает 1–2% длительности файла, то есть часовой разговор становится текстом примерно за минуту. Запись нужно скачать файлом (mp3, wav, m4a, ogg, aac) и загрузить в транскрибация аудио в текст: приёма по ссылке нет, очный разговор можно писать с микрофона. Одно-два интервью в месяц закрываются бесплатно через Telegram-бот для расшифровки голосовых @VoicePalatineBot, до 100 транскрибаций в день.
На именах, аббревиатурах и жаргоне модель ошибается, поэтому заведите глоссарий терминов проекта. Текст выдаётся на языке речи, кросс-языкового перевода нет: интервью на казахском останется казахским. И решите, какой текст нужен: verbatim со всеми «эээ» и повторами идёт на анализ речи и в суд, для кодирования смыслов берите вычищенный вариант.
Кодирование, или как размечать ответы вместо пересказа
Код это короткая метка смысла, привязанная к цитате и тайм-коду. Строка разметки состоит из пяти полей, например: 00:12:40, Р3 из закупок в SMB, «я просто выгружаю в Excel и считаю руками», код «выгрузка в Excel», тип «обходной путь». Джонни Салданья делит работу на два цикла: первый ставит метки на цитаты, второй сводит их в паттерн-коды (термин Майлза и Хубермана).
| Способ кодирования | Когда подходит | Где ломается | Что на выходе |
|---|---|---|---|
| Открытое, индуктивное | тема новая, гипотез нет | десятки синонимов, сведение стоит дня | черновой список кодов |
| По заданной схеме, дедуктивное | серия по одной гипотезе, кодировщиков несколько | не видит того, чего в схеме нет | сравнимые срезы по сегментам |
| In vivo, кодом идёт дословная фраза | нужен язык клиента для текстов и интерфейса | коды не обобщаются | словарь формулировок клиента |
| Процессное, метка действием («жду подтверждения») | восстановить шаги и место обрыва | не годится для эмоций и оценок | карта сценария с точками отказа |
Второй цикл сводит синонимы в кодировочную таблицу, она же кодировочная книга. Структура записи проверена у Маккуин с коллегами (1998): название, краткое определение, полное определение, когда применять, когда не применять, пример цитаты. Если размечают двое, согласие считают каппой Коэна по шкале Ландиса и Коха (1977): 0,61–0,80 это существенное согласие, ниже 0,41 наборы несравнимы и коды надо переопределять.
Анализ custdev интервью ломается именно здесь: коды подгоняются под гипотезу, и противоречащее ей в разметку не попадает. Склонность искать подтверждения, а не опровержения, Питер Уэйсон показал ещё в 1960 году. Заводите отдельный код «против гипотезы». Бывает, что он собирает больше цитат, чем основная линия.
Паттерны и инсайты из интервью, чем вывод отличается от красивой цитаты
Паттерн считается по респондентам, упоминания не считаются совсем. Разговорчивый человек даёт восемь реплик про одну боль, а при пересчёте по людям её назвал он один. Процентов на малых выборках лучше не выводить: на девяти респондентах один человек весит 11 процентных пунктов, поэтому «шесть человек из девяти» честнее, чем «67% пользователей».
| Интервью в одном сегменте | Что уже можно утверждать | Где ломается | Что на выходе |
|---|---|---|---|
| 1–3 | язык клиента, правки гайда | любое обобщение и любая частота | вопросы на следующие разговоры |
| 4–6 | основные повторяющиеся темы | краевые сценарии не видны | черновая схема кодов |
| 7–12 | новые коды почти не появляются | второй сегмент сюда не подшить | приоритеты с частотами по людям |
| Больше 12 или новый сегмент | различия сегментов | разметка отстаёт от записей | сравнение сегментов и решение |
Понятие насыщения ввели Глейзер и Штраусс в 1967 году, а измерили Гест, Банс и Джонсон в 2006-м: на 60 интервью базовые темы проявились в первых шести. Правило «пяти пользователей» Нильсена и Ландауэра (1993) сюда не переносится: пятеро ловят большинство проблем интерфейса в юзабилити-тесте, но о распространённости мнений не говорят ничего.
Дальше ищите противоречия, там и прячутся инсайты из интервью. Респондент говорит, что пользуется отчётом еженедельно, а на просьбе описать последний случай выясняется, что он был несколько месяцев назад.
Инсайт кроме наблюдения держит контекст и следствие. «Пользователям неудобен статус заказа» звучит как отчёт. Рабочая формулировка иначе: клиенты сегмента SMB звонят менеджеру, потому что статус «в обработке» не различает оплату и сборку. Черновик сводки собирается быстрее через саммари из видео и аудио.
Инструменты, минимальный набор и где он врёт
Специализированный софт на первых проектах не нужен: хватает расшифровки и таблицы с кодами. Доска для стикеров окупается, когда кодов больше тридцати. Плеер нужен с горячими клавишами на скорость: спорный фрагмент разбирают на 0,75, знакомый пролистывают на 1,5.
Языковые модели склеивают двух респондентов в одного и выдают фразу, которой в записи не звучало, поэтому инсайты из интервью от модели сверяйте с тайм-кодом. Текстовый поиск не находит синонимы: запрос «дорого» пропустит «не укладываемся в бюджет». Диаризация путается при наложении речи и на коротких репликах вроде «да, да, понял».
Начать проще всего с одной записи. Возьмите последнее глубинное интервью, расшифруйте с тайм-кодами, разметьте первые десять цитат и посчитайте коды по респондентам. Чаще всего вскрывается одно и то же: половина цитат ложится под один код, а выборка отвечает не на тот вопрос, что заявлен в research question. Узнать это на одном интервью дешевле, чем на девяти.