Перетащите аудио или видео – или нажмите, чтобы выбратьMP3 · WAV · M4A · OGG · MP4 · до 30 минут
Пример результата – так выглядит готовая расшифровка
00:58РусскийСпикеры: 2
00:00Спикер 1

Расскажите, с чего начался проект и кто были ваши первые пользователи?

00:07Спикер 2

Начинали с небольшой команды и одного кейса – расшифровки подкастов. Первые пользователи пришли из профессионального сообщества монтажёров.

00:17Спикер 1

А что оказалось самым сложным на старте?

00:24Спикер 2

Удержание. Люди приходили попробовать, но возвращались не все. Мы переработали онбординг и подняли удержание второй недели почти вдвое.

00:35Спикер 1

Какую метрику вы считаете главной сегодня?

00:41Спикер 2

Долю минут, которые пользователь обрабатывает повторно. Если возвращается с новыми файлами – значит, продукт стал частью рабочего процесса.

AI-саммари

Журналист расспрашивает основателя о запуске продукта; собеседник рассказывает про первых пользователей и метрику удержания.

Транскрибация лекций и конспект из аудио и видео

Транскрибация лекций в текст и конспект из аудио и видео - точность WER 7,10%, от 0,29 ₽/мин, деление на спикеров, тайм-коды. 100 бесплатных расшифровок в день.

  • Точность 92,9% (WER 7,10%)
  • Тайм-коды и спикеры
  • ~100 языков
  • 152-ФЗ · данные в РФ
  • от 0,29 ₽/мин
Живое демо: включите микрофон – текст появится сразу
Нажмите поле, разрешите микрофон и говорите по-русски – текст появится здесь в реальном времени
живое демо · потоковая транскрибация в реальном времени

Что делает транскрибация лекций

Конспект лекции по сути сжатое изложение тезисов и определений, а расшифровка лекции даёт для него сырьё: полный дословный текст того, что произнёс лектор. Сервис берёт файл записи и возвращает текст, размеченный по времени и по говорящим. Дальше вы решаете, оставить дословный вариант или свернуть его в короткий конспект.

Текст лекции на выходе бывает двух видов. Дословный сохраняет речь как есть, со всеми повторами и оговорками, и нужен, когда важна каждая формулировка лектора. Очищенный вариант вы готовите под конспект, вычищая слова-паразиты вручную или через LLM. Тайм-коды и деление на спикеров остаются в обоих: к любой фразе можно вернуться по метке времени, например к определению на 14-й минуте.

Как перевести лекцию в текст онлайн

Запись лекции в текст онлайн делается без установки программ: файл загружается через браузер или пересылается боту. От загрузки до готового текста проходит три шага, и все они идут на нашей стороне.

  1. Загрузите файл лекции, аудио или видео, в дашборд или отправьте боту.
  2. Выберите язык распознавания (русский, языки СНГ, всего около 100).
  3. Заберите текст с тайм-кодами.

Оговорка про язык: перевод в текст здесь означает расшифровку в исходном языке. Кросс-языкового перевода, дубляжа или озвучки сервис не делает, английская лекция останется английским текстом.

Почему расшифровка важнее скорости

Студент теряет смысл лекции не потому, что медленно пишет, а потому что выбирает между «слушать» и «записывать». Точная транскрибация снимает этот выбор: сначала вы получаете дословный текст лекции, и только потом спокойно превращаете его в конспект. Ошибка в одном термине на записи по химии или праву дороже, чем лишняя минута обработки, поэтому мы вкладываемся именно в точность распознавания.

Валерий Гречин, CEO Palatine Speech

Почему расшифровка важнее скорости
Студент теряет смысл лекции не потому, что медленно пишет, а потому что выбирает между «слушать» и «записывать». Точная транскрибация снимает этот выбор: сначала вы получаете дословный текст лекции, и только потом спокойно превращаете его в конспект. Ошибка в одном термине на записи по химии или праву дороже, чем лишняя минута обработки, поэтому мы вкладываемся именно в точность распознавания.
Валерий ГречинCEO Palatine Speech

Форматы аудио и видео лекций

На вход принимаются и видеофайлы, и аудио: контейнеры MP4, MOV, MP3, WAV, M4A, OGG и другие распространённые форматы. Лекцию с камеры, экранную запись вебинара и диктофонную дорожку сервис читает одинаково, потому что распознаёт звук, а не оболочку файла.

Дальше два входных сценария расходятся в деталях, и им отведены отдельные разделы ниже. Результат в обоих случаях один: чистый текст лекции по видео или по звуку, с тайм-кодами и делением на спикеров. Ограничение честное: если запись обрывается на середине фразы, оборвётся и расшифровка, дописать несказанное сервис не станет.

Видеолекции и записи вебинаров

Видеолекция попадает в расшифровку так же, как любой другой файл. Транскрибация лекций принимает видеозапись занятия: лекцию с камеры, запись вебинара, онлайн-курс или сохранённый Zoom-звонок в любом распространённом контейнере. Сервис вытягивает речь из аудиодорожки и возвращает текст с тайм-кодами и делением на спикеров. Перекодировать ролик заранее не нужно, звуковая дорожка извлекается автоматически, даже если это MP4 двухчасового вебинара. По времени обработка укладывается в те же 1–2% длительности, что и для звука, поэтому такой файл превращается в текст за пару минут.

Распознаётся именно речь. Текст на слайдах, формулы на доске и надписи в кадре сервис не считывает: оптического распознавания в кадре нет, поэтому таблицу со слайда придётся сверять вручную. Субтитры к видеолекции приходят отдельным файлом SRT или VTT с тайм-кодами. В само видео они не прожигаются, а подключаются в плеере или видеоредакторе на вашей стороне, и собрать субтитры к видео удобнее на профильной странице. Лекцию с YouTube по ссылке загрузить нельзя, приёма ссылок YouTube, VK и Rutube нет: скачайте ролик файлом и загрузите его в сервис, дальше перевести видеозапись в текст получится так же, как для локального файла.

Аудиолекции и звук с семинара

Лекция аудио идёт в обработку сразу после видео по частоте запросов: диктофонная запись занятия, подкаст-лекция или звук, снятый на телефон в аудитории. Сервис работает с аудиодорожкой напрямую, поэтому если на входе только звуковая дорожка, перекодировать её заранее не нужно. Двухчасовой семинар с диктофона возвращается текстом с делением на спикеров примерно за пару минут.

Звук лекции из видеозаписи обрабатывается ровно как отдельный аудиофайл: результат тот же, текст лекции по звуку с тайм-кодами. На семинаре с обсуждением диаризация различает реплики лектора и вопросы из зала даже на шумной записи, так что дискуссию потом легко разложить по говорящим. Диктофонную дорожку достаточно загрузить файлом в дашборд или переслать боту, отдельная конвертация не нужна, а как расшифровать запись с диктофона пошагово, показано на смежной странице.

Точность распознавания речи

На бенчмарке из 7 датасетов точность составляет WER 7,10% и WAcc 92,9%. Это рядом с ElevenLabs (6,88%) и AssemblyAI (7,03%) и точнее Whisper-large-v3 (7,44%). Мы показываем измеримый WER и методику замера, а не маркетинговые «99%».

Нейросеть для расшифровки лекций работает как специализированный ASR, а не как универсальный чат-бот, которому скормили аудио. На длинной записи разница видна: узкая модель не выбрасывает куски дорожки и держит термины, тогда как чат-бот на часовой лекции легче теряет фрагмент или дорисовывает несказанное. Для записи по химии, праву или медицине это принципиально: ошибка в одном термине искажает смысл всего конспекта, поэтому приоритет отдан точности, а не лишней секунде скорости.

Форматы выгрузки текста лекции

Текст лекции выгружается в пяти форматах: json, verbose_json, text, srt и vtt. Формат text даёт чистый текст под конспект, без разметки. Файлы srt и vtt содержат субтитры с тайм-кодами для видеолекции. Формат verbose_json отдаёт текст вместе с тайм-кодами и спикерами для детального разбора, а json удобен как компактная структура для интеграции.

Выбор формата зависит от задачи. Под ручной конспект берут text и вычищают его в редакторе. Для монтажа субтитров к записи занятия подойдут srt или vtt, они подключаются в плеере без прожига в видео. Если текст лекции уходит в другой сервис или в LLM для сжатия, удобнее verbose_json: тайм-коды и метки спикеров остаются машиночитаемыми.

Конспект лекции из расшифровки

Конспект лекции получается из расшифровки в три приёма: сначала точный текст, потом структура по тайм-кодам и спикерам, потом сжатие в тезисы. Готовая расшифровка уже размечена: у каждой реплики есть метка времени, у семинара проставлено деление на лектора и зал. По такой разметке дословный текст легко свернуть в структурированный конспект по разделам, привязав тезис к минуте записи.

Готовый структурированный конспект нейросеть за вас не соберёт, и обещать этого мы не будем. AI-саммари даёт короткий пересказ записи, примерно как подпись под примером результата в начале страницы, но это выжимка на несколько предложений, а не конспект по вашей структуре. Развёрнутый конспект лекций онлайн вы собираете из готового текста сами или в связке с текстовой LLM; если нужна короткая выжимка из записи сразу, она уже встроена в результат. Путь из лекции в конспект онлайн начинается с качественной расшифровки, без неё любые тезисы наследуют ошибки распознавания.

Стоимость расшифровки лекции

Расшифровка стоит от 0,29 ₽/мин по модели pay-as-you-go: платите за минуты записи, без подписки и абонплаты. Часовая лекция обходится ориентировочно от 17 рублей. Баланс не сгорает, секунды округляются вниз, а сама обработка занимает около 1–2% длительности файла, так что часовая запись готова примерно за минуту.

Тарифная сетка одна для видео и аудио: цена считается по минутам звучания, а не по весу файла. Разовому пользователю удобно прикинуть сумму заранее, а вузу или сервису, который прогоняет сотни часов, тестовый объём выделяем по запросу и считаем ставку под нагрузку отдельно.

Длительность лекцииСтоимость от 0,29 ₽/минВремя обработки
1 часориентировочно от 17 ₽около минуты (1–2%)
10 часов (600 минут)около 174 ₽несколько минут

Бесплатная расшифровка лекций

Бесплатно расшифровать лекцию можно через Telegram-бот @VoicePalatineBot: он делает до 100 транскрибаций в день. Перешлите ему войс, аудиофайл или видео лекции и получите текст без оплаты, прямо в чате.

У бота есть рамки, о которых честно предупреждаем: суточный лимит в 100 расшифровок и формат чата вместо дашборда. Для длинной серии лекций или командной работы удобнее веб-кабинет. Бесплатный объём здесь считается расшифровками в день, а не пакетом минут: понятный ориентир это до 100 транскрибаций через бота, а больший тестовый объём выделяем по запросу.

API и интеграция

Для вузов и сервисов есть OpenAI-совместимый API с диаризацией: задачу отправляете запросом, а готовность забираете опросом. Вебхуков нет, сервис не дёрнет ваш адрес по готовности, поэтому статус вы проверяете сами. Это честное ограничение интеграции, о котором лучше знать заранее, чем упереться в него на боевой нагрузке.

Данные лекций остаются в России: 4 ЦОД уровня Tier III, хранение по 152-ФЗ, передача по TLS. Закрытые семинары и внутренние лекции идут через тот же контур, а для бизнеса оформляется договор.

Сколько стоит расшифровка

0,29 ₽/мин, pay-as-you-go. Объёмы для бизнеса выделяем по запросу. Баланс не сгорает, секунды округляются вниз.

Длительность аудио600мин · 10 ч
10 мин6 000 мин
✓ Укладывается в 1 000 бесплатных минут – по запросу
Итого за обработку
174
Новым пользователям 1 000 минут бесплатно – выделяем по запросу

Ответы на вопросы

Не нашли ответ на свой вопрос? Напишите нам

Как перевести лекцию в текст онлайн?

Загрузите файл записи лекции (аудио или видео) в дашборд Palatine Speech или отправьте его боту @VoicePalatineBot. Система распознаёт речь и возвращает готовый текст лекции с тайм-кодами. «Перевести в текст» здесь означает расшифровку речи в исходном языке, а не перевод на другой язык.

Можно ли расшифровать лекцию с YouTube по ссылке?

Прямой приём ссылок YouTube, VK или Rutube не поддерживается. Скачайте видео лекции файлом и загрузите его в сервис – распознавание отработает так же, как для любого аудио или видео.

Сколько стоит расшифровка одной лекции?

Тариф – от 0,29 ₽/мин по модели pay-as-you-go. Часовая лекция обойдётся ориентировочно от 17 рублей. Баланс не сгорает, секунды округляются вниз.

Насколько точно распознаётся речь лектора?

Точность на бенчмарке из 7 датасетов – WER 7,10% и WAcc 92,9%. Для записей с одним спикером в тихой аудитории это близко к результату ручной расшифровки.

Разделит ли сервис реплики лектора и студентов?

Да, доступна диаризация – деление записи на спикеров. В расшифровке семинара реплики разных участников помечаются, что удобно для дискуссий и вопросов из зала.

В каких форматах я получу текст лекции?

Доступны json, verbose_json, text, srt и vtt. Форматы srt и vtt дают субтитры с тайм-кодами для видеолекции, text – чистый текст для конспекта.

Можно ли расшифровать лекцию бесплатно?

Да. Telegram-бот @VoicePalatineBot делает до 100 бесплатных транскрибаций в день – перешлите ему войс, аудио или видео и получите текст.

Сделает ли нейросеть готовый конспект, а не сплошной текст?

Palatine Speech выдаёт точную расшифровку речи с тайм-кодами и делением на спикеров – это основа конспекта. Сжатие в тезисы вы выполняете сами или в связке с текстовой LLM; сервис отвечает за качественный переход из речи в текст.