До 5 дикторов
Автоопределение числа говорящих. Слияние и разделение кластеров исправляют случаи, когда спикеры склеились или один раздвоился.
Размечаем до 5 дикторов с таймкодами. API возвращает транскрипт по спикерам в JSON, SRT и VTT. Многоканальное аудио, real-time, 0,30 ₽/мин или дешевле.
1000 минут по запросу на тест · ответ в JSON за минуты · баланс не сгорает
Реальный вывод API: каждая реплика помечена спикером и тайм-кодом. Так выглядит ответ диаризации до ручной правки.
Добрый день! Подскажите, у вас транскрибация звонков идёт в реальном времени или после завершения разговора?
Здравствуйте! Поддерживаем оба режима: потоковый – прямо во время звонка, и пакетный – когда загружаете записи после смены.
Нам важно деление на спикеров и тайм-коды, чтобы видеть, где говорит оператор, а где клиент.
Диаризация включена по умолчанию: каждая реплика помечена спикером и временем. Дальше это можно отдавать в amoCRM по API.
А какая точность на телефонном канале? У нас часто шумные линии и фоновые звуки.
На телефонии 8 килогерц держим WER около десяти процентов, на чистом аудио – порядка семи. Есть отдельная модель под шумные каналы.
Хорошо, давайте запустим пилот. Сколько займёт подключение?
Доступ к API дам сегодня, пилот рассчитан на две недели. Пришлю ключ, документацию и расчёт по вашим восьми тысячам минут в сутки.
Клиент уточняет сроки внедрения речевой аналитики в колл-центре и интеграцию с amoCRM. Менеджер подтверждает пилот на 2 недели и обещает прислать доступ к API и расчёт по 8 000 минут в сутки.
OpenAI-совместимый эндпоинт. Один запрос – транскрипт, размеченный по спикерам, в JSON, SRT или VTT.
Напишите в Telegram-бот или на support@palatine.ru – выдадим API-ключ и 1000 минут по запросу.
POST с аудио или ссылкой и параметром do_diarize=true. Поддерживается многоканальное аудио.
В ответе – сегменты с speaker, start, end и текстом. Выгрузка в JSON, SRT, VTT, CSV или XLSX.
curl https://api.palatine.ru/api/v1/transcribe/do_diarize \
-H "Authorization: Bearer $API_KEY" \
-F "file=@call.mp3" \
-F "language=ru" \
-F "do_diarize=true" \
-F "num_speakers=auto"{
"task_id": "f3c1...",
"data": {
"language": "ru",
"duration": 64.2,
"speakers": 2,
"segments": [
{ "start": 0.4, "end": 5.8, "speaker": "speaker_0",
"text": "Добрый день! Подскажите, у вас транскрибация в реальном времени?" },
{ "start": 6.2, "end": 13.1, "speaker": "speaker_1",
"text": "Здравствуйте! Поддерживаем оба режима – потоковый и пакетный." },
{ "start": 13.6, "end": 19.4, "speaker": "speaker_0",
"text": "Нам важно деление на спикеров и тайм-коды." }
]
}
}Не просто «кто говорит» – полный набор для речевой аналитики и стенограмм по ролям.
Автоопределение числа говорящих. Слияние и разделение кластеров исправляют случаи, когда спикеры склеились или один раздвоился.
Поканальные записи телефонии: каждый канал атрибутируется говорящему почти без ошибок. Большинство РФ-API такое не поддерживают.
Работает в офисе, на улице и на шумных линиях колл-центра. Есть отдельная модель под телефонный канал 8 кГц.
Диаризация анализирует акустику голоса, а не слова, поэтому работает на любом языке. Распознавание речи – 100 языков с автоопределением.
Тайм-коды на каждое слово и сегмент. Выгрузка в SRT и VTT с метками спикеров – готовые субтитры по ролям.
Потоковая диаризация через WebSocket (wss://) и локальное офлайн-развёртывание в закрытом контуре заказчика.
Сравнение по открытым данным конкурентов. Цены проверены в июне 2026.
| Palatine | Другой РФ-API | pyannote (open source) | Ручная разметка | ||
|---|---|---|---|---|---|
| Цена за минуту | 0,30 ₽ | 0,72 ₽ | своя GPU-инфраструктура | 600–1000 ₽/час | |
| Многоканальное аудио | |||||
| Real-time / WebSocket | |||||
| Готовый JSON/SRT/VTT | |||||
| Данные в РФ (152-ФЗ) | зависит от хостинга | ||||
| On-premise | |||||
| Поддержка и SLA |
Колл-центр, медиа, госструктура или продукт – подберём тариф, лимиты и контур.
Не нашли ответ на свой вопрос? Напишите нам
Это автоматическая разметка «кто и когда говорит» в записи. Распознавание речи превращает звук в текст, а диаризация делит этот текст по спикерам с тайм-кодами. Без неё расшифровка многоголосого разговора – сплошная стена текста; с ней получается стенограмма по ролям (Спикер 1, Спикер 2).
До 5 дикторов с автоопределением количества. Слияние и разделение кластеров исправляют случаи «два спикера склеились» или «один раздвоился». Лучшая точность – на чистом звуке с минимумом перебиваний.
Распознавание речи (ASR) отвечает на вопрос «что сказано»; диаризация – «кто и когда говорил» (метки Спикер ½ без имён); идентификация – «чей именно это голос». В API Palatine транскрибация и диаризация работают в связке: один запрос – готовая стенограмма по ролям.
0,30 ₽/мин или дешевле. Pay-as-you-go: без подписок, баланс не сгорает, секунды округляются вниз в пользу клиента. На старте – 1000 минут по запросу. Для сравнения, ближайший РФ-API берёт за диаризацию около 0,72 ₽/мин.
Да. Диаризация анализирует акустику голоса, а не слова, поэтому она языконезависима. Модель Palatine мультиязычная, а распознавание речи поддерживает около 100 языков с автоопределением.
Да, это наше отличие: при поканальной записи телефонии каждый канал атрибутируется говорящему практически без ошибок. Большинство РФ-API канальную диаризацию не поддерживают. Плюс шумоустойчивость для офиса, улицы и колл-центра.
Да: real-time скорость моделей и потоковая обработка через WebSocket (wss://). В отложенном режиме обработка занимает 1–2% длительности файла – около 25 секунд на 30-минутную запись.
Да, на тарифе On-Premise: локальное офлайн-развёртывание в вашем контуре, автомасштабирование и кастомизация. В облаке данные обрабатываются в 4 ЦОД Tier III в РФ по 152-ФЗ, модели не обучаются на ваших данных.