Ручная и автоматическая транскрибация: что выбрать

Перетащите аудио или видео или нажмите, чтобы выбратьMP3 · WAV · M4A · OGG · MP4 · до 30 минут
Пример результата – так выглядит готовая расшифровка
00:47РусскийСпикеры: 2
00:00Спикер 1

Давай коротко по срокам. Мы успеваем к пятнице или переносим на следующую неделю?

00:07Спикер 2

К пятнице успеваем, если макеты придут завтра. Если позже, то реалистичнее вторник, и это я ещё не закладываю правки после ревью.

00:18Спикер 1

Понял. Тогда я тереблю дизайн сегодня, а ты пока начинаешь с той части, которая от макетов не зависит.

00:25Спикер 2

Договорились. И ещё момент: на прошлой неделе мы забыли записать решение по интеграции, потом полчаса вспоминали. Давай в этот раз зафиксируем сразу.

AI-саммари

Фрагмент рабочего созвона: обсуждают сроки по задаче и договариваются, кто отвечает за следующий шаг.

Ручная и автоматическая транскрибация спорят у нас в чате раз в месяц, а я закрываю спор арифметикой. Мой файл выглядел так. Час интервью, три спикера, кофейня на фоне, сдать к десяти утра. Тогда я и начал считать, во что мне обошлась расшифровка аудио. В минутах и рублях.

Способов ровно три. Нейросеть, наёмный расшифровщик и мои пальцы на клавиатуре. И где предел у каждого? Точно не там, где обещает реклама.

Способ 1. Автоматическая расшифровка нейросетью

Автоматическая расшифровка занимает в моём блокноте самую скучную строчку. Загрузил файл, налил кофе, забрал текст. Мы распознаём запись за 1–2% её длительности. Получасовое интервью придёт вам за 25 секунд, часовое за минуту. На одном файле это придирка. А когда файлов сорок? На тех же тридцати минутах Yandex SpeechKit тратит около двух минут, OpenAI около десяти.

Точность мы меряем через WER, долю ошибочных слов. У нас WER 7,10% и WAcc 92,9% на бенчмарке из семи датасетов, каждое четырнадцатое слово вам стоит проверить. Соседи вплотную. У ElevenLabs 6,88%, у AssemblyAI 7,03%, у Whisper-large-v3 7,44%. Эти доли я на слух не различаю. А что различаю? Телефонный канал 8 кГц сжимает голос, точность на нём около 90%. Фамилии и аббревиатуры мы напишем так, как услышали, поэтому вычитка расшифровки нужна вам всегда.

Мы принимаем файл или микрофон. Форматы mp3, wav, m4a, ogg, aac. Поля для ссылки на видео нет, ролик вы скачиваете и загружаете сами (я его минут пять искал). Языков около сотни, русский и языки СНГ тоже, но текст мы отдаём на языке записи. Казахский разговор станет казахским текстом, перевода не будет. Отдаём txt, json, verbose_json, srt, vtt плюс тайм-коды и диаризацию, деление реплик по спикерам. Проверьте на своём файле там, где живёт транскрибация аудио в текст.

Способ 2. Профессиональная расшифровка. Вы покупаете чужие часы

За что вы платите здесь? За чужое внимание. Исполнитель слушает вашу запись, оформляет реплики и сверяет термины. Мутный звук вместе с «нужно к утру» поднимает цену быстрее, чем объём.

Одну вещь я выяснил на третьем заказе. Исполнители начинают с автоматического прогона и дальше правят текст. Платите вы за вычитку. Расстраивает меня другое. Исполнитель уехал в отпуск, а мой дедлайн не сдвинулся. И моя запись уходит третьему лицу, вопрос NDA я решаю всерьёз.

Когда я всё-таки плачу? Когда нужна дословность, которую кто-то будет оспаривать. И когда запись тяжёлая. Пять человек перебивают друг друга под шум кофемашины. Мы разложим такое по спикерам с ошибками, а живой человек догадается, кто сказал про сроки.

Способ 3. Ручная расшифровка своими руками

Ручная расшифровка проигрывает мне по арифметике. Разговорная речь идёт около 120 слов в минуту, а вслепую вы набираете вдвое или втрое медленнее. Час записи разворачивается в четыре часа, у меня выходило ближе к шести. Первые двадцать минут идут бодро. А дальше?

Техника мне помогает, но экономит она проценты. Что у меня осталось в работе?

  • замедлить воспроизведение до 0,75, тогда перемоток меньше;
  • не оформлять на ходу. Сначала текст, потом реплики, потом заголовки;
  • диктовать вслух за говорящим, если вы так умеете. Я не умею.

Разумной ручная расшифровка остаётся у меня на коротком и на секретном. Трёхминутную голосовую я разбираю сам, открыть сервис мне дольше. А разговор, который нельзя показывать никому? Его я расшифрую лично.

Сравнение стоимости и времени на часовой записи

Сравнение стоимости и времени станет честным, когда вы подставите свою часовую ставку. Транскрибация часовой записи у нас стоит около 17 рублей. Стоимость минуты расшифровки от 0,29 ₽, в часе шестьдесят минут, платите вы по факту и без подписки.

А тот же час вручную? Он стоит вам четыре-шесть часов жизни, и при скромных 500 ₽ в час это две-три тысячи.

Второй параметр я вспомнил позже и заплатил нервным воскресеньем. Срок возврата. Мы отдаём текст, пока вы наливаете кофе, исполнитель через сутки, вы сами через выходные. Оплату pay-as-you-go мы считаем по секундам с округлением вниз, баланс не сгорает. А если платить не хочется? Бесплатный Telegram-бот для расшифровки голосовых @VoicePalatineBot берёт до 100 транскрибаций в день.

Что сравниваемАвтоматическая расшифровкаПрофессиональная расшифровкаРучная расшифровка
Час записи в текст заоколо минутыпо заявке, от суток4–6 часов вашей работы
Точность на стартеWER 7,10%, верно 92,9% словблизко к дословной после вычиткизависит от усидчивости
Во что обходитсяот 0,29 ₽/мин, около 17 ₽ за часставка за минуту записиваша часовая ставка × 4–6
Где ломаетсяшум, телефонный канал 8 кГц (около 90%), фамилиичужое расписание, запись у третьего лицавсё длиннее двадцати минут

Одну графу я в таблицу не вставлю. Ручная расшифровка единственная, где я плачу временем, и потому кажется бесплатной. Ручная и автоматическая транскрибация сходятся в одной строке моего бюджета, валюта только разная.

Что выбрать под конкретную задачу

Что выбрать, я решаю одним вопросом. Что вы сделаете с текстом дальше? Нужен поиск по разговору? Берите автоматику и не вычитывайте, опечатка не помешает вам прыгнуть по тайм-коду. Текст пойдёт в суд? Дословность обеспечит вам человек, и профессиональная расшифровка окупается здесь.

А объём? Он меняет мой ответ ещё раз. Одна ваша запись в месяц живёт в боте, десяток в неделю мы обработаем в веб-интерфейсе. Поток от сотен файлов вы заведёте через speech-to-text API, он принимает файлы и распознаёт поток по WebSocket. Документация на docs.speech.palatine.ru.

Отдельно про то, куда уходит запись. Мы держим её в четырёх ЦОД уровня Tier III в России, передаём по TLS, работаем по 152-ФЗ, на клиентских файлах модели не дообучаем. Фрилансер с биржи такого не гарантирует. Для разговора про зарплаты это решает.

Не верьте ни одному сравнению, включая моё. Что выбрать, покажет вам один неудобный файл. Возьмите телефонный разговор, где вас перебивают.

  • Прогоните его через наш бесплатный бот и засеките время.
  • Вычитайте первые десять минут расшифровки, глядя на часы.
  • Умножьте потраченное на длительность и сравните с ручным вариантом.

Коэффициент вычитки и есть ваш ответ. У студийной записи он около нуля. А у планёрки на громкой связи он вышел такой, что я закрыл ноутбук, отдал файл человеку и провёл вечер иначе.