Перетащите аудио или видео – или нажмите, чтобы выбратьMP3 · WAV · M4A · OGG · MP4 · до 30 минут
Пример результата – так выглядит готовая расшифровка
00:58РусскийСпикеры: 2
00:00Спикер 1

Расскажите, с чего начался проект и кто были ваши первые пользователи?

00:07Спикер 2

Начинали с небольшой команды и одного кейса – расшифровки подкастов. Первые пользователи пришли из профессионального сообщества монтажёров.

00:17Спикер 1

А что оказалось самым сложным на старте?

00:24Спикер 2

Удержание. Люди приходили попробовать, но возвращались не все. Мы переработали онбординг и подняли удержание второй недели почти вдвое.

00:35Спикер 1

Какую метрику вы считаете главной сегодня?

00:41Спикер 2

Долю минут, которые пользователь обрабатывает повторно. Если возвращается с новыми файлами – значит, продукт стал частью рабочего процесса.

AI-саммари

Журналист расспрашивает основателя о запуске продукта; собеседник рассказывает про первых пользователей и метрику удержания.

Транскрибация MP3 в текст

Транскрибация MP3 в текст онлайн: загрузите файл - получите расшифровку. Точность WER 7,10%, ~100 языков, деление по спикерам, тайм-коды, экспорт TXT/DOCX/SRT/VTT. От 0,29 ₽/мин, 100 файлов в день бесплатно в Telegram-боте.

  • Точность 92,9% (WER 7,10%)
  • Тайм-коды и спикеры
  • ~100 языков
  • 152-ФЗ · данные в РФ
  • от 0,29 ₽/мин
Живое демо: включите микрофон – текст появится сразу
Нажмите поле, разрешите микрофон и говорите по-русски – текст появится здесь в реальном времени
живое демо · потоковая транскрибация в реальном времени

Что такое расшифровка MP3 в текст

Внутри mp3 только звук, сжатый с потерями. Речь, музыка, шум, но ни одного символа текста. Расшифровка mp3 (она же мп3 расшифровка) и означает превратить звучащую речь в письменный текст силами ASR, без наборщика в наушниках.

Расшифровка мп3 и перевод MP3 в текст здесь про одно и то же: записать сказанное словами на исходном языке, а не переложить на другой. Даже если в файле кто-то поёт, сервис разберёт вокал как речь и не станет подбирать готовые строки. За словами трека это на страницу про распознавание текста песни, тут мы их не ищем.

Как перевести MP3 в текст онлайн за 3 шага

Загрузите mp3 или мп3-запись: перетащите файл в форму или наговорите звук с микрофона. Приёма по ссылке нет. Для видео сначала сохраните аудиодорожку, а уже потом кидайте файл, так что «скачал, загрузил» вместо «вставил ссылку».

Дальше ждать почти нечего. Обработка занимает ~1–2% от длительности записи: 10-минутный файл готов за 6–12 секунд. Остаётся забрать результат, он отдаётся в TXT, DOCX, SRT или VTT.

Почему битрейт важнее формата

MP3 уже сжатый звук, но для расшифровки решает не контейнер, а чистота записи. На 128 kbps и выше мы стабильно держим WER около 7%, и падение битрейта тут вредит куда сильнее, чем сам факт «это же mp3».

Проблемы начинаются в другом месте: когда спикеры перебивают друг друга или запись сделана в шуме. Тогда и выручают диаризация с тайм-кодами, иначе реплики склеиваются в один сплошной поток без границ.

Валерий Гречин, CEO Palatine Speech

Почему битрейт важнее формата
MP3 – это уже сжатый звук, но для расшифровки решает не сам контейнер, а чистота записи: на 128 kbps и выше мы стабильно держим WER около 7%. Проблемы начинаются там, где спикеры перебивают друг друга или запись сделана в шуме – тогда выручают диаризация и разметка по тайм-кодам.
Валерий ГречинCEO Palatine Speech

Точность распознавания MP3

По MP3 мы держим WER 7,10% и WAcc 92,9%. Цифра не из воздуха: это бенчмарк на 7 датасетах, вплотную к ElevenLabs (6,88) и AssemblyAI (7,03).

На практике точность гуляет от битрейта, шума и того, как сильно голоса наложились друг на друга. Чистая запись 128 kbps и выше распознаётся заметно ровнее телефонных 8 кГц, там планка проседает примерно до 90%.

Деление по спикерам и тайм-коды

Диаризация разводит реплики по отдельным спикерам, а тайм-коды привязывают каждую к моменту записи. Интервью, планёрка, созвон превращаются в читаемый транскрипт, где видно, кто и когда говорил.

На часовом интервью это и экономит больше всего. Не приходится вслушиваться и вручную помечать, где сменился голос. Два собеседника получают роли «Спикер 1» и «Спикер 2» автоматически; трое и больше размечаются так же аккуратно, разметка не рассыпается.

Поддерживаемые форматы и экспорт

Помимо MP3 на вход идут WAV, M4A, OGG и видео. Можно называть это конвертером mp3 в текст, можно сказать «преобразовать мп3 в текст» или «mp3 в слова», суть одна: сервис вытягивает из файла речь и отдаёт её в TXT, DOCX, SRT, VTT и JSON. Субтитры SRT и VTT несут тайм-коды, а JSON берут, когда данные надо конвертировать мп3 в текст и сразу передать в свою систему.

Только «конвертер» тут слово условное. Контейнер сервис не переупаковывает и mp3 в слова механически не превращает: под капотом распознавание речи, где сначала ASR разбирает звук и лишь потом появляется текст. Перевести mp3 в текст и конвертировать один формат в другой это разные операции, вторую мы не делаем.

MP3 в TXT: что содержит готовый текстовый файл

Когда нужен именно mp3 в txt, после распознавания вы получаете голый текстовый файл: слова с пунктуацией, без тайм-кодов и без оформления. Дальше маршруты расходятся. TXT забирают, чтобы скопировать расшифровку, переслать в мессенджере или вставить в документ. SRT, VTT, DOCX и JSON берут, когда важны тайм-коды, разбивка на реплики или последующая правка.

Получить txt из mp3 это не «переупаковать» аудиоконтейнер в другой формат. Текстового слоя в самом mp3 нет, текст рождается из звучащей речи силами ASR, поэтому мгновенной конвертации файла не бывает: сперва распознавание, затем выгрузка. Файл сохраняется в обычной текстовой кодировке и открывается любым редактором. DOCX вместо TXT имеет смысл, когда расшифровку сразу пойдут править, а чистый .txt проще прогонять через скрипты и вставлять в сторонние поля.

Формат выгрузкиЧто внутриКогда брать
TXTЧистый текст с пунктуацией, без тайм-кодов и стилейСкопировать, переслать, вставить в документ
DOCXТот же текст в редактируемом документеДальше править и форматировать в Word
SRT / VTTТекст с тайм-кодами, разбитый на репликиСубтитры к видео
JSONТекст плюс пословные тайминги и метаданныеИнтеграция и разбор в своём коде через API

Если из mp3 нужны именно субтитры к ролику, разумнее сразу сделать субтитры в SRT или VTT с готовыми тайм-кодами, а не собирать их потом вручную из чистого TXT.

Языки распознавания

Распознавание речи из mp3 работает на ~100 языках. Русский и языки СНГ идут без ручного выбора: язык определяется сам, отдельно указывать его не нужно.

Кросс-языкового перевода тут нет. Речь на русском станет русским текстом, казахская останется казахской. На английский её никто не переложит, сервис записывает сказанное на том языке, на котором говорили.

Сколько стоит перевести MP3 в текст

Транскрибация MP3 стоит от 0,29 ₽/мин по модели pay-as-you-go. Баланс не сгорает, секунды округляются вниз, платите ровно за фактическую длительность. Оплата картой МИР, через СБП или по счёту, без VPN.

Бесплатного пакета минут у веб-сервиса нет, он честно тарифицируется поминутно. Разовый короткий файл дешевле прогнать через бесплатный Telegram-бот, о нём чуть ниже.

Калькулятор стоимости

Возьмём 600 минут аудио, это ровно 10 часов (максимум слайдера 6 000 мин). Выходит 174 ₽: те же 600 минут по 0,29 ₽ и складываются в эту сумму. Баланс не сгорает, а объёмы для бизнеса выделяем по запросу.

Бесплатный поток живёт в Telegram-боте @VoicePalatineBot, до 100 файлов в день. Тестовые минуты для веб-сервиса тоже даём по запросу.

MP3 в текст бесплатно в Telegram-боте

Нужна разовая расшифровка? Транскрибация бесплатно доступна в Telegram-боте @VoicePalatineBot: перешлите ему войс, аудио или видео и заберите мп3 в текст бесплатно, до 100 файлов в день, без установки программ.

Бот хорош для коротких разовых записей. Под поток файлов или длинные лекции логичнее брать веб-сервис с поминутной оплатой и API, а бесплатный лимит бота держать под быстрые проверки на ходу.

Расшифровка MP3 через API

Под поток файлов есть API. Чтобы распознать mp3 в текст программно, отправьте запрос на OpenAI-совместимый POST /audio/transcriptions. Доступны диаризация, тайм-коды и форматы ответа json/verbose_json/text/srt/vtt.

Для файлов используется polling: статус готовой расшифровки забирают опросом, вебхуков нет. Документация лежит на docs.speech.palatine.ru.

Безопасность и хранение данных

Аудио обрабатывается в 4 ЦОД Tier III на территории РФ по 152-ФЗ. Передача защищена TLS, обработка и хранение за пределы РФ не выходят.

Загруженный mp3 и его расшифровка привязаны к вашему аккаунту, результат забираете вы, а не кто-то посторонний. Для юрлиц объёмы и условия хранения оговариваются отдельно по запросу.

Сколько стоит расшифровка

0,29 ₽/мин, pay-as-you-go. Объёмы для бизнеса выделяем по запросу. Баланс не сгорает, секунды округляются вниз.

Длительность аудио600мин · 10 ч
10 мин6 000 мин
✓ Укладывается в 1 000 бесплатных минут – по запросу
Итого за обработку
174
Новым пользователям 1 000 минут бесплатно – выделяем по запросу

Ответы на вопросы

Не нашли ответ на свой вопрос? Напишите нам

Как перевести MP3 в текст онлайн?

В 3 шага: загрузите MP3-файл в форму, дождитесь распознавания речи, скачайте готовый текст в TXT, DOCX, SRT или VTT.

Можно ли расшифровать MP3 бесплатно?

Да. Перешлите MP3 Telegram-боту @VoicePalatineBot – до 100 транскрибаций в день бесплатно, без установки программ.

Сколько стоит транскрибация MP3?

От 0,29 ₽/мин по модели pay-as-you-go. Баланс не сгорает, секунды округляются вниз, платите только за фактическую длительность аудио.

В каких форматах отдаётся текст?

TXT, DOCX, SRT, VTT и JSON. Субтитры SRT/VTT содержат тайм-коды, JSON удобен для интеграции.

Определяет ли сервис разных спикеров?

Да, диаризация размечает в расшифровке MP3 отдельных спикеров и проставляет тайм-коды.

Какая точность распознавания MP3?

WER 7,10% и WAcc 92,9% на бенчмарке из 7 датасетов. Точность зависит от битрейта и уровня шума в записи.

На каких языках работает распознавание?

На ~100 языках, включая русский и языки СНГ. Язык определяется автоматически.

Можно ли расшифровывать MP3 через API?

Да. API OpenAI-совместимый: POST /audio/transcriptions, форматы ответа json/verbose_json/text/srt/vtt, для файлов используется polling.

Где хранятся мои аудио?

В 4 ЦОД Tier III на территории РФ по 152-ФЗ. Модели на данных клиентов не обучаются, передача защищена TLS.