Что такое диаризация

Перетащите аудио или видео или нажмите, чтобы выбратьMP3 · WAV · M4A · OGG · MP4 · до 30 минут
Пример результата – так выглядит готовая расшифровка
00:47РусскийСпикеры: 2
00:00Спикер 1

Давай коротко по срокам. Мы успеваем к пятнице или переносим на следующую неделю?

00:07Спикер 2

К пятнице успеваем, если макеты придут завтра. Если позже, то реалистичнее вторник, и это я ещё не закладываю правки после ревью.

00:18Спикер 1

Понял. Тогда я тереблю дизайн сегодня, а ты пока начинаешь с той части, которая от макетов не зависит.

00:25Спикер 2

Договорились. И ещё момент: на прошлой неделе мы забыли записать решение по интеграции, потом полчаса вспоминали. Давай в этот раз зафиксируем сразу.

AI-саммари

Фрагмент рабочего созвона: обсуждают сроки по задаче и договариваются, кто отвечает за следующий шаг.

Диаризация – это разделение записи по говорящим: она отвечает на вопрос «кто говорит», а не «что сказано». Когда в аудио звучат два человека и больше, диаризация размечает, где чья реплика, и ставит тайм-код к каждой. На выходе не сплошная стена текста, а диалог, в котором видно автора каждой фразы.

Слово пришло из английского diarization и закрепилось в речевых технологиях. Рядом обычно стоит распознавание речи: одно превращает звук в буквы, другое подписывает, кто их произнёс. Ниже разберём определение, отличие от транскрибации, механику и сценарии, где без разметки говорящих не обойтись.

Что такое диаризация простыми словами

Если совсем коротко, диаризация – это ответ на вопрос «кто и когда говорил». Сервис слушает запись, находит границы, где один голос сменяет другой, и присваивает каждому фрагменту метку спикера. Реплики одного участника собираются под одной подписью, даже если он вступает в разговор десять раз за час.

Сама по себе метка спикера текста не даёт. Поэтому разметку говорящих почти всегда используют в паре с распознаванием речи: сначала звук делится по голосам, затем под каждым голосом появляется текст. Результат читается как сценарий: «Спикер 1», его слова, «Спикер 2», его слова, и так до конца записи.

Что такое диаризация: Разделение записи по говорящим: кто и в какие моменты говорил

Чем диаризация отличается от транскрибации

Разница в вопросе, на который они отвечают. Транскрибация решает «что сказано» и выдаёт текст речи. Диаризация решает «кто сказал» и выдаёт разметку по спикерам. Это два разных слоя обработки одного и того же аудио, и путать их не стоит: голая расшифровка часового совещания без диаризации превращается в трудночитаемый монолит.

Вместе эти два слоя дают то, что обычно и нужно, – текст с атрибуцией. Каждая реплика подписана участником и временем, поэтому запись становится структурой, а не потоком. По такому тексту уже можно считать, кто сколько говорил, и открывать нужную минуту в один клик.

На практике это заметно на любом диалоге. Возьмите запись собеседования на 40 минут: без разметки это 6 тысяч слов подряд, где вопрос рекрутера и ответ кандидата слипаются в один абзац. С диаризацией те же 40 минут превращаются в аккуратный сценарий из реплик двух спикеров, и на подготовку саммари уходит не полдня, а несколько минут.

Как работает диаризация

Технически диаризация опирается на голосовые эмбеддинги – числовые «отпечатки» голоса. Сервис нарезает запись на короткие сегменты, считает для каждого такой отпечаток и группирует похожие: сегменты с близкими акустическими признаками относятся к одному говорящему. Параллельно работает детекция смены спикера – момент, когда голос в записи меняется.

Число участников можно не знать заранее. Оно определяется автоматически, но при желании задаётся подсказкой: точное число говорящих или диапазон. Для разговора один на один хватает режима до 4 говорящих, а для панельной дискуссии или большого совещания есть режим для большего числа участников. От качества записи многое зависит: шум, эхо и перебивки усложняют разметку сильнее, чем сам факт нескольких голосов.

Труднее всего два случая. Первый – наложение речи, когда двое говорят одновременно и голоса накладываются в одном сегменте. Второй – очень похожие голоса или короткие реплики на секунду-две, по которым отпечаток голоса считается неуверенно. Помогает простое правило: чем чище дорожка и чем меньше перебивок, тем точнее разметка, поэтому запись с гарнитуры или отдельного микрофона делится лучше, чем звук из середины шумного зала.

Где нужна диаризация

Диаризация нужна везде, где говорит больше одного человека и важно понять, кому принадлежит фраза. Классика – телефонный разговор: расшифровка звонков с разметкой раскладывает оператора и клиента на две дорожки, и на этом строится речевая аналитика. Дальше идут интервью, совещания, суды и подкасты.

Причина одна на все сценарии: без автора реплики текст теряет половину смысла. В суде важно, кто именно произнёс формулировку, в продажах – сколько говорил менеджер против клиента, в подкасте – где реплика гостя, а где ведущего. Разметка по спикерам отвечает на этот вопрос до того, как вы начнёте вычитывать текст.

Таблица ниже собирает частые сценарии.

СценарийЧто делает диаризацияЧто на выходе
Звонок в колл-центрДелит оператора и клиента2 дорожки реплик с тайм-кодами
ИнтервьюОтделяет вопросы от ответовТекст «интервьюер / собеседник»
Совещание и встречаРазмечает всех участниковПротокол по говорящим
ПодкастРазделяет ведущих и гостяРасшифровка + субтитры со спикерами

Где нужна диаризация: Четыре сценария, где важно, кому принадлежит фраза

Что получаете на выходе

На выходе диаризация даёт реплики, у каждой из которых есть три вещи: метка говорящего, тайм-код и текст. Выглядит это как «Спикер 1 [00:00:12]: …», «Спикер 2 [00:00:19]: …». Тайм-код важен не меньше метки: по нему нужный фрагмент часовой записи находится за секунды, а не перемоткой на слух.

Метки говорящих сначала обезличенные: «Спикер 1», «Спикер 2» и так далее, по порядку появления голосов. Сервис не знает имён, поэтому подписывает участников номерами, а вы при вычитке заменяете их на реальные имена за пару правок. Для звонка это обычно оператор и клиент, для интервью – журналист и собеседник, для совещания – список из 3–5 участников.

Формат выгрузки зависит от задачи. Ниже – что под что брать.

ФорматЧто внутриКогда брать
txtТекст с метками спикеровЗаметка, быстрая правка
json / verbose_jsonСегменты: спикер, время, текстАнализ, интеграция в свою систему
srt / vttРеплики с таймингомСубтитры к видео

Как выглядит результат диаризации: Метка спикера, тайм-код и текст; справа – роль после вычитки

Как сделать диаризацию записи

Чтобы получить диаризацию, загрузите аудио- или видеофайл и включите разметку говорящих: мы распознаём речь и сразу раскладываем её по спикерам с тайм-кодами. Часовая запись обрабатывается примерно за 1–2% своей длительности, то есть за минуту-другую, а не за смену ручной расшифровки. Понимаем около 100 языков, включая русский и языки СНГ.

Данные при этом остаются под защитой: обработка и хранение идут в 4 ЦОД уровня Tier III на территории РФ по 152-ФЗ, соединение защищено TLS. Если разметка говорящих нужна внутри вашего продукта, её отдаёт API диаризации вместе с распознаванием аудио в текст – и для готовых файлов, и для потока.

Попробовать разметку можно и без интеграции. Для короткой записи хватит Telegram-бота @VoicePalatineBot: он обрабатывает до 100 записей в день и вернёт текст с делением по спикерам, а более длинные разговоры удобнее загружать в основной сервис. Стоит распознавание от 0,29 ₽/мин по модели pay-as-you-go, так что диалог на час обходится в считанные рубли, а не в смену ручной расшифровки с пометками, кто что сказал.

Частые вопросы

  1. Что такое диаризация простыми словами? Диаризация – это разделение записи по говорящим: она показывает, кто и в какие моменты говорил. Если в аудио звучат два человека и больше, реплики размечаются по спикерам и к каждой ставится тайм-код.

  2. Чем диаризация отличается от транскрибации? Транскрибация отвечает на вопрос «что сказано», а диаризация – «кто сказал». По отдельности это распознавание речи и разметка говорящих, а вместе они дают текст, где каждая реплика подписана спикером и временем.

  3. Сколько говорящих распознаёт диаризация? Число участников определяется автоматически либо задаётся подсказкой. Есть режим до 4 говорящих и режим для большего числа участников, например для панельной дискуссии или совещания.

  4. Как выглядит результат диаризации? Это последовательность реплик с меткой говорящего и тайм-кодом: «Спикер 1 [00:00:12]: …», «Спикер 2 [00:00:19]: …». Каждый абзац – отдельная реплика конкретного участника, а не сплошная стена текста.

  5. Где применяют диаризацию? В расшифровке звонков (оператор и клиент), интервью, совещаний, судебных заседаний и подкастов. Везде, где говорит больше одного человека и важно понять, кому принадлежит фраза.

  6. В каких форматах отдаётся результат? txt, json, verbose_json, srt и vtt. В json у каждого сегмента есть спикер, время и текст, а srt и vtt сразу годятся как субтитры к видео с подписью говорящего.

  7. Как сделать диаризацию своей записи? Загрузите аудио- или видеофайл в сервис распознавания речи с включённой разметкой говорящих. Мы вернём текст, уже разложенный по спикерам, с тайм-кодами. Отдельно доступен API диаризации.

  8. Точна ли расшифровка при диаризации? Текст под каждой репликой распознаётся с точностью WER 7,10% и WAcc 92,9% по бенчмарку на 7 датасетах, а телефонная дорожка на канале 8 кГц держит около 90%.