Telegram-бот для расшифровки голосовых и аудио в текст
Перешлите голосовое сообщение, аудио или видео-кружок боту{" "} <a href={BOT_URL} target="_blank" rel="noopener noreferrer"> @VoicePalatineBot </a>{" "} - получите готовый текст с делением на спикеров. Точность 92,9%, поддержка ~100 языков, 100 расшифровок в день бесплатно.
- Точность 92,9%
- Голосовые и кружки
- Деление на спикеров
- ~100 языков
- Данные в РФ (152-ФЗ)
- Без VPN и карты
Как расшифровать голосовое сообщение ботом
Telegram-бот @VoicePalatineBot переводит голосовые сообщения в текст прямо в мессенджере. Как бот аудио в текст, он превращает голосовое или аудио в читаемую расшифровку. Музыку он не качает и на другой язык не переводит. Чтобы перевести голосовое в текст, вам не понадобятся приложения, регистрация или карта.
Расшифровка голосовых занимает три шага.
- Откройте бота - перейдите в @VoicePalatineBot и нажмите «Старт».
- Перешлите запись - переслать голосовое боту можно как пересылкой, так и файлом.
- Получите текст - бот вернёт текст из голосового с тайм-кодами за секунды.
Переслать войс боту
Чаще всего голосовое пересылают боту из любого чата. Вы отправляете войс на 2 минуты и через несколько секунд получаете текст со спикерами. Транскрибация в Telegram идёт без копирования ссылок и выгрузки файлов: расшифровка войсов остаётся внутри мессенджера, а голос в текст превращается в один тап.
Поддерживаемые источники: войсы, кружки, файлы
Бот принимает голосовые, видео-кружки и аудиофайлы в форматах MP3, OGG, M4A и WAV. Видео-кружок и пересланное видео он тоже расшифровывает, так что текст из видео можно получить без отдельного сервиса. Бот голосовых сообщений телеграмм работает с любым из этих источников.
Что умеет бот: спикеры, языки, точность
Бот распознаёт русскую речь с точностью WAcc 92,9% (WER 7,10%) и сам делит запись на участников. За расшифровкой стоит ASR-движок Palatine Speech, поэтому голос в текст телеграм переводит на профессиональном уровне.
Деление на спикеров (диаризация)
Диаризация размечает реплики по спикерам и тайм-кодам. Бот понимает, кто и когда говорит, и проставляет тайм-коды и спикеры в готовом тексте. Журналист пересылает аудио интервью и получает расшифровку с разметкой по говорящим, где каждая реплика подписана. Деление на спикеров выручает на интервью, совещаниях и в рабочих переписках, где участвует несколько человек.
~100 языков и автоопределение
Palatine Speech поддерживает около 100 языков с автоопределением. Язык вручную указывать не нужно: бот сам распознаёт русский, языки СНГ и десятки других. Когда в записи звучит русский с вкраплениями другого языка, основной язык он тоже определяет сам.
100 бесплатных расшифровок в день
@VoicePalatineBot даёт 100 бесплатных транскрибаций в день. Эти 100 бесплатно в день честные: лимит обновляется каждые сутки, карта и подписка не нужны, а баланс не сгорает. Многие боты-конкуренты в выдаче ограничивают бесплатный доступ подпиской или малым лимитом. Здесь сто расшифровок доступны сразу, без VPN и карты.
Что входит бесплатно
В бесплатный лимит входят все форматы, деление на спикеров и тайм-коды, причём функции здесь не урезаны. Сотрудник пересылает войс из рабочего чата и читает текст вместо прослушивания, не тратя ни рубля. Ста расшифровок в день хватает, чтобы перестать слушать длинные голосовые.
Объёмы сверх лимита (веб и API)
Когда записей больше ста в день, те же модели доступны через веб-сервис и API. Расшифровка сверх дневного лимита стоит от 0,29 ₽ за минуту: вы платите по факту, и баланс не сгорает. Большие объёмы удобнее обрабатывать через транскрибацию аудио в текст или speech-to-text API, а 1000 минут бесплатно стартапам выделяем по запросу.
| План | Лимит | Что входит | Цена |
|---|---|---|---|
| Бот Free | 100 расшифровок в день | Все форматы, спикеры, тайм-коды | 0 ₽ |
| Веб / API | без лимита | Пакетная обработка, баланс не сгорает | от 0,29 ₽/мин |
| Стартапам | 1000 минут | Выделяем по запросу | бесплатно |
Кому подходит бот
Бот экономит время на прослушивании голосовых всем, кто живёт в Telegram. Он одинаково выручает в рабочих чатах, в журналистике и в дороге, ведь любую запись превращает в текст за секунды.
Войсы рабочих чатов
Команды переводят голосовые из рабочих переписок в текст и читают их вместо прослушивания. Пригодится, когда коллега прислал длинный войс, а вам нужно быстро найти суть и переслать решение дальше.
Интервью и заметки на ходу
Журналисты и блогеры расшифровывают интервью и заметки на ходу прямо из Telegram. Бот для интервью размечает говорящих, поэтому готовый текст сразу можно цитировать. В дороге достаточно надиктовать мысль голосом, и бот вернёт текст для заметок и задач.
Безопасность: данные в России
Обработка записей соответствует требованиям 152-ФЗ. Записи проходят через инфраструктуру в РФ, а не через зарубежные серверы, поэтому данные в РФ остаются под российским законодательством.
152-ФЗ и ЦОД
Серверы Palatine Speech размещены в четырёх ЦОД уровня Tier III в России. Обработка соответствует требованиям 152-ФЗ, передача идёт по TLS, оплата проходит картами МИР и через СБП - без VPN и зарубежных сервисов.
Не обучаем на ваших данных
Мы не обучаем модели на ваших записях и не передаём их третьим лицам. Голосовое расшифровывается и возвращается вам - запись не используется для дообучения ASR.
Точность и советы для лучшего результата
На чистом аудио бот распознаёт речь с точностью WAcc 92,9% (WER 7,10%). Метрики получены на бенчмарке из семи датасетов, где Palatine Speech показал WER 7,10% - на уровне ведущих зарубежных систем.
WER и WAcc
WAcc - доля правильно распознанных слов, WER - доля ошибок; 92,9% точности означает 7,10% ошибок. На шумных и телефонных записях отдельная модель повышает точность примерно до 90%, поэтому войс из машины или с улицы распознаётся корректно.
Как записать, чтобы распознало точнее
- Записывайте голосовое ближе к источнику звука и без фонового шума.
- Назовите имена и редкие термины в начале записи.
- Длинную запись перешлите одним файлом целиком, а не нарезкой коротких фрагментов.
Для диктовки в реальном времени подойдёт диктовка голосом. Если нужен обзор всех инструментов платформы, начните с главной.
Как получить текст голосового сообщения в Telegram, не прослушивая
Текст голосового сообщения нужен не всегда, но когда войс прилетает в середине совещания, прочитать его быстрее, чем дослушать до конца. Бот @VoicePalatineBot возвращает готовый текст голосового с тайм-кодами и делением на спикеров, поэтому запись можно пробежать глазами вместо прослушивания. На пару минут звука уходит несколько секунд обработки, ответ приходит тем же чатом, куда вы переслали голосовое в телеграмме.
Сценарий знакомый: пришёл войс на три минуты, слушать некогда, вы отдаёте его боту и читаете расшифровку. Голосовые сообщения текстом проще переслать дальше, вставить цитатой в переписку и найти поиском по словам, чего со звуковой дорожкой не сделаешь. Длинную запись читать целиком тоже необязательно.
Приложение и платформа тут значения не имеют: способ одинаков на телефоне (iPhone или Android) и в десктопе, войс просто пересылается боту. Если расшифровать нужно не пересланный войс, а собственную надиктовку или запись не из мессенджера, для этого есть отдельный разбор, как надиктовать текст голосом и распознать любую аудиозапись. По ссылке из YouTube или другого сервиса бот записи не принимает, только файлом или пересылкой.
Прочитать голосовое, не включая звук
Причин читать войс молча хватает: открытый офис, где неудобно выводить чужой голос вслух, ночь рядом со спящими, метро без наушников, совещание, на котором нельзя отвлечься. Во всех этих случаях вопрос, как прочитать голосовое, решается одним пересыланием, звук включать не приходится вовсе.
В ответ приходит не сплошная стена символов. Реплики разбиты по спикерам, рядом с каждой стоит тайм-код, так что можно перескочить к нужному месту записи; как формируются тайм-коды в готовом тексте, разобрано отдельно. Даже часовую запись бот обрабатывает примерно за минуту, поэтому текст оказывается перед глазами быстрее, чем если бы вы слушали её целиком.
Нужно ли скачивать голосовое из Telegram перед расшифровкой
Скачать голосовое из телеграмма ради расшифровки обычно не нужно: боту хватает пересылки войса или аудио прямо из чата. Достаточно переслать боту сообщение, и он ответит текстом, промежуточная выгрузка файла на устройство в этой схеме лишняя. Это частое заблуждение: человек сначала ищет, как сохранить голосовое из чата, а про распознавание думает уже потом.
Скачивание оправдано в одном случае: когда вы расшифровываете уже сохранённую запись через веб-сервис, а не через бота. Тогда аудио из телеграмма сохраняют как файл и загружают его в форму, то есть путь строится по схеме «сохрани файл, потом загрузи», а не «вставь ссылку». Так же расшифровывают файлы с диктофона и любые записи, которые уже лежат у вас на телефоне или компьютере.
Если войс всё-таки нужно сохранить
Если голосовое всё же сохранено на устройство, отдельного софта для распознавания не потребуется: сохранённый OGG или M4A уходит боту тем же пересыланием, что и войс из чата. Бот читает MP3, OGG, M4A и WAV, поэтому формат, в котором Telegram или другое приложение отдало запись, роли почти не играет.
Разница появляется на объёме. Разбирать один войс проще через бот, а вот выгружать архив переписки целиком и гонять его по одному сообщению неудобно: для пачки записей быстрее загрузить файлы в веб-сервис. Инструкций по парсингу Telegram и стороннему «вытаскиванию» голосовых мы не даём, это отдельная задача вне распознавания.
Голосовые из WhatsApp и других мессенджеров через файл
Расшифровка в ватсапе устроена через файл, а не через прямой импорт: голосовое из WhatsApp сохраняют как аудио и отправляют боту в Telegram либо загружают в веб-сервис. Схема «сохранить и отправить» одинакова для любого войса, а голосовое из ватсапа превращается в текст тем же движком распознавания, что и войсы Telegram.
Тот же путь работает для голосовых из ВКонтакте и других мессенджеров, а также для видео с речью, сохранённого файлом. Импорта по ссылке из WhatsApp или VK нет, источник только аудиофайл или пересылка. И ещё одна честная оговорка: расшифровка голосового из ватсапа на русский означает распознавание русской речи, то есть речь на русском станет русским текстом. Кросс-языкового перевода на другой язык бот не делает.
Чем бот отличается от встроенной расшифровки в Telegram
Отдельного бота для расшифровки ищут те, у кого встроенная расшифровка Telegram либо недоступна, либо не устраивает по результату. Логичный вопрос: зачем отдельный голосовой бот телеграмм, если клиент и так умеет показывать текст войса. Ответ в том, что задачи разные, и для части сценариев встроенной функции просто не хватает.
Отличия, которые мы можем назвать проверяемо, лежат в четырёх вещах: деление на спикеров по тайм-кодам, распознавание речи примерно на 100 языках с автоопределением, отдельная модель под шумный и телефонный канал и обработка данных внутри РФ. Точность на русском у бота WAcc 92,9% при WER 7,10%, на зашумлённой и телефонной записи около 90%. Про саму встроенную функцию Telegram мы не выдумываем ни лимитов, ни процентов: этих цифр компания не публикует, поэтому сравниваем наши числа с качественными формулировками.
| Что сравниваем | Встроенная расшифровка Telegram | Бот @VoicePalatineBot |
|---|---|---|
| Деление на спикеров | реплики идут сплошным текстом, без пометки, кто говорит | размечает спикеров по тайм-кодам (диаризация) |
| Языки | набор языков Telegram отдельно не заявляет | около 100 языков с автоопределением |
| Шумная и телефонная запись | отдельной модели под шум Telegram не заявляет | отдельная модель, на шумном канале около 90% |
| Точность на русском | цифры Telegram не публикует | WAcc 92,9%, WER 7,10% |
| Сторонние аудиофайлы | остаётся внутри переписки | принимает MP3, OGG, M4A, WAV как сервис |
| Где обрабатываются данные | на стороне Telegram | в РФ по 152-ФЗ, 4 ЦОД Tier III, передача по TLS |
| Стоимость и доступ | без пересылки, прямо в чате клиента | 100 расшифровок в день бесплатно, сверх от 0,29 ₽/мин |
Честно про минус: у бота есть свой дневной потолок в 100 расшифровок, и всё сверх него уже платное, от 0,29 ₽/мин через веб и API. Встроенная расшифровка живёт прямо в клиенте, ничего никуда пересылать не надо, и для бытового «купи хлеб» этого достаточно.
Когда хватает встроенной, а когда нужен бот
Для короткого бытового войса встроенной расшифровки чаще всего хватает: одно-два предложения, один голос, чистый звук, читать можно прямо в переписке. Гонять такое через отдельного бота смысла мало, лишнее действие ради того же результата.
Бот выигрывает там, где голосов несколько и важно, кто из них что сказал: интервью, планёрка, запись звонка. Сюда же попадают шумная или телефонная запись, сторонний аудиофайл из другого мессенджера и случаи, когда данные должны оставаться в российском контуре по 152-ФЗ. Из часовой планёрки, кстати, удобнее сразу получить краткую выжимку, а не вычитывать всю расшифровку построчно.
Голосовые и кружки расшифровываются прямо в Telegram – пользователю не нужно выгружать файлы во внешние сервисы. Записи остаются в нашем контуре на территории РФ, а 100 расшифровок в день мы отдаём бесплатно: без карты, подписки и VPN.
Ответы на вопросы
Как расшифровать голосовое сообщение в Telegram?
Откройте бота @VoicePalatineBot и перешлите ему голосовое сообщение – он вернёт текст с тайм-кодами и делением на спикеров за несколько секунд.
Сколько это стоит?
В боте 100 расшифровок в день бесплатно, без карты и подписки. Для больших объёмов – от 0,29 ₽ за минуту через веб-сервис и API.
Какие форматы понимает бот?
Голосовые Telegram, видео-кружки, аудиофайлы (MP3, OGG, M4A, WAV) и видео. Можно переслать запись или прикрепить файл.
Бот определяет, кто говорит?
Да, диаризация включена: каждая реплика помечается спикером и тайм-кодом – удобно для интервью и совещаний.
Какая точность распознавания?
На чистом аудио WAcc 92,9% (WER 7,10%), на телефонном и шумном канале – около 90% за счёт отдельной модели.
Какие языки поддерживаются?
Около 100 языков, включая русский и языки СНГ; язык определяется автоматически.
Безопасно ли пересылать записи боту?
Данные обрабатываются в РФ по 152-ФЗ в четырёх ЦОД Tier III, передаются по TLS, на них не обучаются модели и не передаются третьим лицам.
Что делать, если нужно больше 100 расшифровок в день?
Подключите веб-сервис Palatine Speech или speech-to-text API – те же модели, оплата по минутам от 0,29 ₽, баланс не сгорает.
Нужны ли регистрация и VPN?
Для бота аккаунт не нужен – просто откройте его в Telegram. VPN тоже не требуется: оплата и обработка идут внутри РФ.
Как прочитать голосовое сообщение, не прослушивая его?
Перешлите войс боту @VoicePalatineBot, и он вернёт текст голосового с тайм-кодами. Запись читаешь вместо прослушивания, а работает это одинаково на телефоне и в десктопе.
Нужно ли скачивать голосовое из Telegram перед расшифровкой?
Нет, боту достаточно пересылки войса или аудио. Скачивать файл нужно только когда вы расшифровываете уже сохранённую запись через веб-сервис: тогда её загружают файлом.
Можно ли расшифровать голосовое из WhatsApp?
Да, через файл. Сохраните голосовое из WhatsApp как аудио и отправьте его боту в Telegram или загрузите в веб-сервис. Импорта по ссылке из других мессенджеров нет, распознаётся тот же язык, на другой язык бот речь не переводит.
Чем бот лучше встроенной расшифровки Telegram?
Бот размечает спикеров, распознаёт около 100 языков, держит отдельную модель под шумный и телефонный канал и обрабатывает данные в РФ по 152-ФЗ. Встроенная функция удобнее для короткого бытового войса без пересылки.
Бот переводит голосовое на русский или на другой язык?
Бот расшифровывает речь в текст на том же языке, на котором она звучит. Это распознавание, а не перевод: голосовое на русском станет русским текстом, кросс-языкового перевода нет.