Диаризация – это разделение записи по говорящим: она отвечает на вопрос «кто говорит», а не «что сказано». Когда в аудио звучат два человека и больше, диаризация размечает, где чья реплика, и ставит тайм-код к каждой. На выходе не сплошная стена текста, а диалог, в котором видно автора каждой фразы.
Слово пришло из английского diarization и закрепилось в речевых технологиях. Рядом обычно стоит распознавание речи: одно превращает звук в буквы, другое подписывает, кто их произнёс. Ниже разберём определение, отличие от транскрибации, механику и сценарии, где без разметки говорящих не обойтись.
Что такое диаризация простыми словами
Если совсем коротко, диаризация – это ответ на вопрос «кто и когда говорил». Сервис слушает запись, находит границы, где один голос сменяет другой, и присваивает каждому фрагменту метку спикера. Реплики одного участника собираются под одной подписью, даже если он вступает в разговор десять раз за час.
Сама по себе метка спикера текста не даёт. Поэтому разметку говорящих почти всегда используют в паре с распознаванием речи: сначала звук делится по голосам, затем под каждым голосом появляется текст. Результат читается как сценарий: «Спикер 1», его слова, «Спикер 2», его слова, и так до конца записи.

Чем диаризация отличается от транскрибации
Разница в вопросе, на который они отвечают. Транскрибация решает «что сказано» и выдаёт текст речи. Диаризация решает «кто сказал» и выдаёт разметку по спикерам. Это два разных слоя обработки одного и того же аудио, и путать их не стоит: голая расшифровка часового совещания без диаризации превращается в трудночитаемый монолит.
Вместе эти два слоя дают то, что обычно и нужно, – текст с атрибуцией. Каждая реплика подписана участником и временем, поэтому запись становится структурой, а не потоком. По такому тексту уже можно считать, кто сколько говорил, и открывать нужную минуту в один клик.
На практике это заметно на любом диалоге. Возьмите запись собеседования на 40 минут: без разметки это 6 тысяч слов подряд, где вопрос рекрутера и ответ кандидата слипаются в один абзац. С диаризацией те же 40 минут превращаются в аккуратный сценарий из реплик двух спикеров, и на подготовку саммари уходит не полдня, а несколько минут.
Как работает диаризация
Технически диаризация опирается на голосовые эмбеддинги – числовые «отпечатки» голоса. Сервис нарезает запись на короткие сегменты, считает для каждого такой отпечаток и группирует похожие: сегменты с близкими акустическими признаками относятся к одному говорящему. Параллельно работает детекция смены спикера – момент, когда голос в записи меняется.
Число участников можно не знать заранее. Оно определяется автоматически, но при желании задаётся подсказкой: точное число говорящих или диапазон. Для разговора один на один хватает режима до 4 говорящих, а для панельной дискуссии или большого совещания есть режим для большего числа участников. От качества записи многое зависит: шум, эхо и перебивки усложняют разметку сильнее, чем сам факт нескольких голосов.
Труднее всего два случая. Первый – наложение речи, когда двое говорят одновременно и голоса накладываются в одном сегменте. Второй – очень похожие голоса или короткие реплики на секунду-две, по которым отпечаток голоса считается неуверенно. Помогает простое правило: чем чище дорожка и чем меньше перебивок, тем точнее разметка, поэтому запись с гарнитуры или отдельного микрофона делится лучше, чем звук из середины шумного зала.
Где нужна диаризация
Диаризация нужна везде, где говорит больше одного человека и важно понять, кому принадлежит фраза. Классика – телефонный разговор: расшифровка звонков с разметкой раскладывает оператора и клиента на две дорожки, и на этом строится речевая аналитика. Дальше идут интервью, совещания, суды и подкасты.
Причина одна на все сценарии: без автора реплики текст теряет половину смысла. В суде важно, кто именно произнёс формулировку, в продажах – сколько говорил менеджер против клиента, в подкасте – где реплика гостя, а где ведущего. Разметка по спикерам отвечает на этот вопрос до того, как вы начнёте вычитывать текст.
Таблица ниже собирает частые сценарии.
| Сценарий | Что делает диаризация | Что на выходе |
|---|---|---|
| Звонок в колл-центр | Делит оператора и клиента | 2 дорожки реплик с тайм-кодами |
| Интервью | Отделяет вопросы от ответов | Текст «интервьюер / собеседник» |
| Совещание и встреча | Размечает всех участников | Протокол по говорящим |
| Подкаст | Разделяет ведущих и гостя | Расшифровка + субтитры со спикерами |

Что получаете на выходе
На выходе диаризация даёт реплики, у каждой из которых есть три вещи: метка говорящего, тайм-код и текст. Выглядит это как «Спикер 1 [00:00:12]: …», «Спикер 2 [00:00:19]: …». Тайм-код важен не меньше метки: по нему нужный фрагмент часовой записи находится за секунды, а не перемоткой на слух.
Метки говорящих сначала обезличенные: «Спикер 1», «Спикер 2» и так далее, по порядку появления голосов. Сервис не знает имён, поэтому подписывает участников номерами, а вы при вычитке заменяете их на реальные имена за пару правок. Для звонка это обычно оператор и клиент, для интервью – журналист и собеседник, для совещания – список из 3–5 участников.
Формат выгрузки зависит от задачи. Ниже – что под что брать.
| Формат | Что внутри | Когда брать |
|---|---|---|
| txt | Текст с метками спикеров | Заметка, быстрая правка |
| json / verbose_json | Сегменты: спикер, время, текст | Анализ, интеграция в свою систему |
| srt / vtt | Реплики с таймингом | Субтитры к видео |

Как сделать диаризацию записи
Чтобы получить диаризацию, загрузите аудио- или видеофайл и включите разметку говорящих: мы распознаём речь и сразу раскладываем её по спикерам с тайм-кодами. Часовая запись обрабатывается примерно за 1–2% своей длительности, то есть за минуту-другую, а не за смену ручной расшифровки. Понимаем около 100 языков, включая русский и языки СНГ.
Данные при этом остаются под защитой: обработка и хранение идут в 4 ЦОД уровня Tier III на территории РФ по 152-ФЗ, соединение защищено TLS. Если разметка говорящих нужна внутри вашего продукта, её отдаёт API диаризации вместе с распознаванием аудио в текст – и для готовых файлов, и для потока.
Попробовать разметку можно и без интеграции. Для короткой записи хватит Telegram-бота @VoicePalatineBot: он обрабатывает до 100 записей в день и вернёт текст с делением по спикерам, а более длинные разговоры удобнее загружать в основной сервис. Стоит распознавание от 0,29 ₽/мин по модели pay-as-you-go, так что диалог на час обходится в считанные рубли, а не в смену ручной расшифровки с пометками, кто что сказал.
Частые вопросы
-
Что такое диаризация простыми словами? Диаризация – это разделение записи по говорящим: она показывает, кто и в какие моменты говорил. Если в аудио звучат два человека и больше, реплики размечаются по спикерам и к каждой ставится тайм-код.
-
Чем диаризация отличается от транскрибации? Транскрибация отвечает на вопрос «что сказано», а диаризация – «кто сказал». По отдельности это распознавание речи и разметка говорящих, а вместе они дают текст, где каждая реплика подписана спикером и временем.
-
Сколько говорящих распознаёт диаризация? Число участников определяется автоматически либо задаётся подсказкой. Есть режим до 4 говорящих и режим для большего числа участников, например для панельной дискуссии или совещания.
-
Как выглядит результат диаризации? Это последовательность реплик с меткой говорящего и тайм-кодом: «Спикер 1 [00:00:12]: …», «Спикер 2 [00:00:19]: …». Каждый абзац – отдельная реплика конкретного участника, а не сплошная стена текста.
-
Где применяют диаризацию? В расшифровке звонков (оператор и клиент), интервью, совещаний, судебных заседаний и подкастов. Везде, где говорит больше одного человека и важно понять, кому принадлежит фраза.
-
В каких форматах отдаётся результат? txt, json, verbose_json, srt и vtt. В json у каждого сегмента есть спикер, время и текст, а srt и vtt сразу годятся как субтитры к видео с подписью говорящего.
-
Как сделать диаризацию своей записи? Загрузите аудио- или видеофайл в сервис распознавания речи с включённой разметкой говорящих. Мы вернём текст, уже разложенный по спикерам, с тайм-кодами. Отдельно доступен API диаризации.
-
Точна ли расшифровка при диаризации? Текст под каждой репликой распознаётся с точностью WER 7,10% и WAcc 92,9% по бенчмарку на 7 датасетах, а телефонная дорожка на канале 8 кГц держит около 90%.