Анализ звонков: как разбирать разговоры по расшифровке

Перетащите аудио или видео или нажмите, чтобы выбратьMP3 · WAV · M4A · OGG · MP4 · до 30 минут
Пример результата – так выглядит готовая расшифровка
00:47РусскийСпикеры: 2
00:00Спикер 1

Давай коротко по срокам. Мы успеваем к пятнице или переносим на следующую неделю?

00:07Спикер 2

К пятнице успеваем, если макеты придут завтра. Если позже, то реалистичнее вторник, и это я ещё не закладываю правки после ревью.

00:18Спикер 1

Понял. Тогда я тереблю дизайн сегодня, а ты пока начинаешь с той части, которая от макетов не зависит.

00:25Спикер 2

Договорились. И ещё момент: на прошлой неделе мы забыли записать решение по интеграции, потом полчаса вспоминали. Давай в этот раз зафиксируем сразу.

AI-саммари

Фрагмент рабочего созвона: обсуждают сроки по задаче и договариваются, кто отвечает за следующий шаг.

Анализ звонков упирается в арифметику. Десять менеджеров по 20 разговоров в день дают к пятнице около тысячи записей, а при средней длине пять минут это 83 часа звука. Прослушать столько за неделю нельзя даже на удвоенной скорости, поэтому разбор сводится к выборке. И в выборку попадают не случайные записи, а те, на которые пожаловался клиент.

Расшифровка выводов за вас не сделает, она меняет носитель. Пятиминутный разговор при разговорном темпе 100–140 слов в минуту превращается в 500–700 слов, это около двух стандартных листов по 1800 знаков, которые можно читать, искать по словам и считать. Почему сделка встала, текст не скажет. Зато он перестаёт врать, кто что говорил и на какой минуте.

Зачем анализировать звонки, если руководитель и так слушает записи

Выборка ловит грубое и почти не ловит повторяемое. Возьмите возражение, которое звучит в каждом десятом разговоре. Прослушали пять записей: вероятность не встретить его ни разу равна 0,9 в пятой степени, 59%. Десять записей: 35%. Чтобы застать такое возражение с надёжностью 95%, нужно 29 случайных звонков. Контроль качества звонков по выборке систематически переоценивает скандал и недооценивает мелочь, из которой складывается конверсия.

Второй счёт временной. 100 звонков по 5 минут это 500 минут, 8 часов 20 минут чистого звука, а с остановками ручной разбор идёт примерно вчетверо медленнее записи. Те же 500 минут в тексте это порядка 60 000 слов: читать их подряд смысла нет, зато поиск слова «дорого» по всему массиву занимает секунды и даёт число вместо ощущения. Анализ звонков отдела продаж от этого не становится глубже, он становится полным: весь массив вместо хвоста из жалоб.

Что даёт расшифровка на разных этапах сделки

На первом контакте проверяют квалификацию, и классические рамки подсказывают, что искать. BANT из практики IBM держит четыре признака: бюджет, полномочия, потребность, срок. MEDDIC начала 1990-х разворачивает их в шесть, добавляя метрики, экономического покупателя и внутреннего сторонника. По тексту это ищется словами: «бюджет», «согласовывает», «до какого числа».

На демонстрации и встрече считают пропорцию речи. Диаризация делит запись на спикеров с тайм-кодами, дальше длительности реплик складываются. Порог вы задаёте сами: например, доля менеджера выше 60% эфира на первом звонке уходит в разбор. Модель SPIN Нила Рэкхема (1988) выросла из наблюдения за 35 000 встреч и делит вопросы на ситуационные, проблемные, извлекающие и направляющие: по тексту видно, дошёл ли разговор дальше первых двух типов. Анализ разговоров с клиентами в поддержке считают иначе: там весит доля обращений, закрытых с первого контакта, и повторные звонки по одному поводу, а AHT (разговор, удержание, постобработка) показывает, куда уходит время оператора.

Ближе к закрытию из текста вытаскивают договорённости: что обещали, к какому числу, на каких условиях. Спорное место находится по тайм-коду за секунды, вместе с точной формулировкой обеих сторон, а json с полями start и end в секундах кладётся в карточку сделки. Разговор в духе «я такого не говорил» на этом заканчивается.

ЭтапЧто считатьГде ломаетсяЧто на выходе
Первый контактВопросы про бюджет, полномочия, срокВопрос задан, ответ не зафиксированСделки без квалификации
ДемонстрацияДоля эфира у менеджера, число вопросовМоно-дорожка с перебивками: реплики плывутПорог по пропорции речи
ЗакрытиеСледующий шаг с датой, а не с намерениемШаг назван так, что клиент не заметилЗадачи с тайм-кодом в карточке
ПоддержкаПовторные обращения по одному поводуТот же вопрос идёт в чате и почтеПравки в инструкции

Как выделять задачи, возражения и отклонения от скрипта

Расшифровка звонка и выделение задач держатся на нескольких типах фраз. Обещание менеджера («пришлю расчёт сегодня») это глагол будущего времени рядом с обстоятельством времени. Дальше идут вопрос клиента без ответа, любой срок в реплике, включая «в четверг» и «после праздников», которые регулярное выражение по датам не поймает, и слово «договор» рядом с цифрой. Искать это можно руками, поиском по словам или запросом к языковой модели: разница во времени, а не в принципе.

Из того же текста собирают ещё несколько срезов. Каждый стоит вести списком и раз в месяц пересматривать, иначе критерии устаревают быстрее статистики.

  • Возражения дословно. «Дорого» и «нет бюджета до 2 квартала» требуют разных ответов, хотя в карточке сделки оба превратятся в «дорого». Сведение сотни цитат в 6–8 тем идёт по схеме тематического анализа Брауна и Кларк (2006): шесть фаз от чтения материала до названий тем.
  • Стоп-слова: обещание скидки без согласования, оценки конкурентов, сроки, которых нет в договоре.
  • Рискованные обещания («гарантирую», «мы точно успеем»).

Критерии проверяются по тексту честнее, чем на слух, но у каждого есть слепая зона. Прежде чем считать статистику, разметьте одну и ту же десятую часть выборки двумя оценщиками: каппа Коэна (1960) по шкале Лэндиса и Коха (1977) показывает, договорились люди или нет. Значения 0,61–0,80 считаются существенным согласием, а всё ниже 0,40 означает не плохих оценщиков, а плохо сформулированный критерий. Дальше контроль качества звонков держат смешанным: машина размечает весь массив, человек раз в неделю перечитывает десяток спорных случаев и правит формулировки.

Критерий оценки звонкаКак проверяется по текстуГде метод врётЧто делать
Приветствие и представлениеПоиск по первым 30 секундамПредставился на третьей минутеРасширить окно до 60 секунд
Вопрос про задачу клиентаВопросы в первой трети текстаВопрос формальный, ответ в две секундыМерить длину ответа клиента
Следующий шагДата рядом с глаголом действия«Созвонимся на той неделе» без числаСчитать шагом только дату
Отработка возраженияРеплика клиента плюс ответ менеджераУместность ответа текст не оцениваетВычитка человеком раз в неделю

Анализ звонков нейросетью: что автоматизируется, а что остаётся людям

Анализ звонков нейросетью начинается с распознавания, а потолок распознаванию ставит телефония. Телефонный канал живёт на частоте дискретизации 8 кГц, то есть по теореме Котельникова несёт полосу до 4 кГц, а на практике 300–3400 Гц кодека G.711 при 64 кбит/с. Свистящие и шипящие держат основную энергию выше 4 кГц, поэтому «с» и «ш» путаются первыми, а с ними фамилии и названия компаний. G.729 сжимает поток до 8 кбит/с и добивает остатки. Широкополосные G.722 и Opus работают от 16 кГц, так что режим HD voice в АТС стоит включить заранее: пересчитать готовый файл с 8 кГц на 16 кГц бесполезно, потерянных частот в нём уже нет. Имена, продукты и отраслевые термины лучше собрать в словарь до заливки.

Второе узкое место это диаризация. Обе стороны в одной моно-дорожке, границы реплик размываются, пропорция речи начинает лгать. Двухканальная запись, где каждый абонент идёт своим каналом, делится чище, включается в настройках АТС и почти ничего не стоит по месту: минута wav 8 кГц/16 бит моно занимает около 1 МБ, минута mp3 на 64 кбит/с около полумегабайта, час разговора укладывается в 60 МБ.

Людям остаётся причинность. Модель посчитает, что возражение про цену прозвучало в 40 звонках из 100, и соберёт саммари из видео и аудио с тезисами и задачами. Почему оно прозвучало, она не скажет: за словом «дорого» может стоять источник лидов, а не скрипт, и проверяется это сравнением сегментов трафика. Оценка тона тоже остаётся за вами.

Как запустить анализ звонков на своих записях

Первый шаг скучный: выгрузите записи из телефонии или CRM в файлы. Мы в Palatine Speech принимаем файл (mp3, wav, m4a, ogg, aac) или диктовку с микрофона, а ссылку на плеер вашей АТС не открываем, сначала скачиваете запись, потом загружаете. Обработка занимает 1–2% длительности, WAcc на нашем бенчмарке из семи датасетов 92,9%, на телефонной дорожке около 90%, цена от 0,29 ₽/мин без подписки. Форматы выгрузки и контур хранения описаны на странице транскрибация звонков, а поток из телефонии заводится через speech-to-text API.

Второй шаг юридический, и его дешевле пройти до заливки архива. Запись разговора с клиентом это персональные данные: согласие субъекта описано в статье 9 закона 152-ФЗ, уведомление в Роскомнадзор об обработке в статье 22, а голос переходит в разряд биометрических данных по статье 11, когда по нему устанавливают личность. Отсюда практика: предупреждение о записи в начале разговора, зафиксированные цель обработки и срок хранения, уничтожение данных в срок до 30 дней после достижения цели (статья 21).

Начинать лучше с малого, иначе разбор бросают на третий день. Возьмите 20 звонков одного менеджера за неделю, прочитайте подряд и отмечайте всё, что цепляет. Обычно вылезают две-три дыры: нет назначенного следующего шага, беспомощный ответ на «дорого», презентация вместо квалификации. Когда критерии перестанут переписываться каждый день, расширяйте разметку на весь отдел. Проверить, как распознаётся именно ваша телефония, можно в @VoicePalatineBot: до 100 транскрибаций в день бесплатно.