Диаризация спикеров по API – определение «кто говорит»

Размечаем до 5 дикторов с таймкодами. API возвращает транскрипт по спикерам в JSON, SRT и VTT. Многоканальное аудио, real-time, 0,30 ₽/мин или дешевле.

  • До 5 дикторов
  • 0,30 ₽/мин или дешевле
  • real-time
  • Многоканальное аудио
  • 152-ФЗ · данные в РФ
  • on-premise
Хотите увидеть разметку спикеров на своей записи? Загрузите аудио и посмотрите результат в браузере

1000 минут по запросу на тест · ответ в JSON за минуты · баланс не сгорает

Пример: диалог колл-центра, размеченный по спикерам

Реальный вывод API: каждая реплика помечена спикером и тайм-кодом. Так выглядит ответ диаризации до ручной правки.

Перетащите аудио или видео – или нажмите, чтобы выбратьMP3 · WAV · M4A · OGG · MP4 · до 30 минут
Пример результата – так выглядит готовая расшифровка
01:04РусскийСпикеры: 2
00:00Спикер 1

Добрый день! Подскажите, у вас транскрибация звонков идёт в реальном времени или после завершения разговора?

00:06Спикер 2

Здравствуйте! Поддерживаем оба режима: потоковый – прямо во время звонка, и пакетный – когда загружаете записи после смены.

00:13Спикер 1

Нам важно деление на спикеров и тайм-коды, чтобы видеть, где говорит оператор, а где клиент.

00:20Спикер 2

Диаризация включена по умолчанию: каждая реплика помечена спикером и временем. Дальше это можно отдавать в amoCRM по API.

00:29Спикер 1

А какая точность на телефонном канале? У нас часто шумные линии и фоновые звуки.

00:35Спикер 2

На телефонии 8 килогерц держим WER около десяти процентов, на чистом аудио – порядка семи. Есть отдельная модель под шумные каналы.

00:46Спикер 1

Хорошо, давайте запустим пилот. Сколько займёт подключение?

00:51Спикер 2

Доступ к API дам сегодня, пилот рассчитан на две недели. Пришлю ключ, документацию и расчёт по вашим восьми тысячам минут в сутки.

AI-саммари

Клиент уточняет сроки внедрения речевой аналитики в колл-центре и интеграцию с amoCRM. Менеджер подтверждает пилот на 2 недели и обещает прислать доступ к API и расчёт по 8 000 минут в сутки.

Как подключить диаризацию по API

OpenAI-совместимый эндпоинт. Один запрос – транскрипт, размеченный по спикерам, в JSON, SRT или VTT.

  1. Получите ключ

    Напишите в Telegram-бот или на support@palatine.ru – выдадим API-ключ и 1000 минут по запросу.

  2. Отправьте файл

    POST с аудио или ссылкой и параметром do_diarize=true. Поддерживается многоканальное аудио.

  3. Получите спикеров

    В ответе – сегменты с speaker, start, end и текстом. Выгрузка в JSON, SRT, VTT, CSV или XLSX.

Запросbash
curl https://api.palatine.ru/api/v1/transcribe/do_diarize \
  -H "Authorization: Bearer $API_KEY" \
  -F "file=@call.mp3" \
  -F "language=ru" \
  -F "do_diarize=true" \
  -F "num_speakers=auto"
Ответjson
{
  "task_id": "f3c1...",
  "data": {
    "language": "ru",
    "duration": 64.2,
    "speakers": 2,
    "segments": [
      { "start": 0.4, "end": 5.8, "speaker": "speaker_0",
        "text": "Добрый день! Подскажите, у вас транскрибация в реальном времени?" },
      { "start": 6.2, "end": 13.1, "speaker": "speaker_1",
        "text": "Здравствуйте! Поддерживаем оба режима – потоковый и пакетный." },
      { "start": 13.6, "end": 19.4, "speaker": "speaker_0",
        "text": "Нам важно деление на спикеров и тайм-коды." }
    ]
  }
}
Стоимость
Диаризация
0,30 ₽/мин или дешевле
Спикеров
до 5, автоопределение
Многоканальное аудио
поддерживается
Документация

Возможности диаризации Palatine Speech

Не просто «кто говорит» – полный набор для речевой аналитики и стенограмм по ролям.

До 5 дикторов

Автоопределение числа говорящих. Слияние и разделение кластеров исправляют случаи, когда спикеры склеились или один раздвоился.

Многоканальное аудио

Поканальные записи телефонии: каждый канал атрибутируется говорящему почти без ошибок. Большинство РФ-API такое не поддерживают.

Шумоустойчивость

Работает в офисе, на улице и на шумных линиях колл-центра. Есть отдельная модель под телефонный канал 8 кГц.

Языконезависимость

Диаризация анализирует акустику голоса, а не слова, поэтому работает на любом языке. Распознавание речи – 100 языков с автоопределением.

Таймкоды и субтитры

Тайм-коды на каждое слово и сегмент. Выгрузка в SRT и VTT с метками спикеров – готовые субтитры по ролям.

Real-time и on-premise

Потоковая диаризация через WebSocket (wss://) и локальное офлайн-развёртывание в закрытом контуре заказчика.

Palatine против других способов разметки спикеров

Сравнение по открытым данным конкурентов. Цены проверены в июне 2026.

PalatineДругой РФ-APIpyannote (open source)Ручная разметка
Цена за минуту0,30 ₽0,72 ₽своя GPU-инфраструктура600–1000 ₽/час
Многоканальное аудионетнет
Real-time / WebSocketнетнетнет
Готовый JSON/SRT/VTTнетнет
Данные в РФ (152-ФЗ)зависит от хостинга
On-premiseнет
Поддержка и SLAнетнет

Цена за минуту

0,30 ₽
Palatine
0,72 ₽
Другой РФ-API
своя GPU-инфраструктура
pyannote (open source)
600–1000 ₽/час
Ручная разметка

Многоканальное аудио

Palatine
нет
Другой РФ-API
нет
pyannote (open source)
Ручная разметка

Real-time / WebSocket

Palatine
нет
Другой РФ-API
нет
pyannote (open source)
нет
Ручная разметка

Готовый JSON/SRT/VTT

Palatine
Другой РФ-API
нет
pyannote (open source)
нет
Ручная разметка

Данные в РФ (152-ФЗ)

Palatine
Другой РФ-API
зависит от хостинга
pyannote (open source)
Ручная разметка

On-premise

Palatine
нет
Другой РФ-API
pyannote (open source)
Ручная разметка

Поддержка и SLA

Palatine
Другой РФ-API
нет
pyannote (open source)
нет
Ручная разметка

Обсудим внедрение под вашу задачу

Колл-центр, медиа, госструктура или продукт – подберём тариф, лимиты и контур.

Ответы на вопросы

Не нашли ответ на свой вопрос? Напишите нам

Что такое диаризация простыми словами?

Это автоматическая разметка «кто и когда говорит» в записи. Распознавание речи превращает звук в текст, а диаризация делит этот текст по спикерам с тайм-кодами. Без неё расшифровка многоголосого разговора – сплошная стена текста; с ней получается стенограмма по ролям (Спикер 1, Спикер 2).

Сколько спикеров определяет Palatine Speech?

До 5 дикторов с автоопределением количества. Слияние и разделение кластеров исправляют случаи «два спикера склеились» или «один раздвоился». Лучшая точность – на чистом звуке с минимумом перебиваний.

Чем диаризация отличается от распознавания речи и идентификации голоса?

Распознавание речи (ASR) отвечает на вопрос «что сказано»; диаризация – «кто и когда говорил» (метки Спикер ½ без имён); идентификация – «чей именно это голос». В API Palatine транскрибация и диаризация работают в связке: один запрос – готовая стенограмма по ролям.

Сколько стоит диаризация по API?

0,30 ₽/мин или дешевле. Pay-as-you-go: без подписок, баланс не сгорает, секунды округляются вниз в пользу клиента. На старте – 1000 минут по запросу. Для сравнения, ближайший РФ-API берёт за диаризацию около 0,72 ₽/мин.

Работает ли диаризация на русском и других языках?

Да. Диаризация анализирует акустику голоса, а не слова, поэтому она языконезависима. Модель Palatine мультиязычная, а распознавание речи поддерживает около 100 языков с автоопределением.

Поддерживается ли многоканальное аудио звонков?

Да, это наше отличие: при поканальной записи телефонии каждый канал атрибутируется говорящему практически без ошибок. Большинство РФ-API канальную диаризацию не поддерживают. Плюс шумоустойчивость для офиса, улицы и колл-центра.

Можно ли делать диаризацию в реальном времени?

Да: real-time скорость моделей и потоковая обработка через WebSocket (wss://). В отложенном режиме обработка занимает 1–2% длительности файла – около 25 секунд на 30-минутную запись.

Можно ли развернуть диаризацию on-premise?

Да, на тарифе On-Premise: локальное офлайн-развёртывание в вашем контуре, автомасштабирование и кастомизация. В облаке данные обрабатываются в 4 ЦОД Tier III в РФ по 152-ФЗ, модели не обучаются на ваших данных.

Подключите диаризацию по API сегодня

1000 минут по запросу · 0,30 ₽/мин или дешевле · ответ в JSON за минуты

  • До 5 спикеров
  • Данные в РФ, 152-ФЗ
  • OpenAI-совместимость