Ручная и автоматическая транскрибация: что выбрать

Перетащите аудио или видео или нажмите, чтобы выбратьMP3 · WAV · M4A · OGG · MP4 · до 30 минут
Пример результата – так выглядит готовая расшифровка
00:47РусскийСпикеры: 2
00:00Спикер 1

Давай коротко по срокам. Мы успеваем к пятнице или переносим на следующую неделю?

00:07Спикер 2

К пятнице успеваем, если макеты придут завтра. Если позже, то реалистичнее вторник, и это я ещё не закладываю правки после ревью.

00:18Спикер 1

Понял. Тогда я тереблю дизайн сегодня, а ты пока начинаешь с той части, которая от макетов не зависит.

00:25Спикер 2

Договорились. И ещё момент: на прошлой неделе мы забыли записать решение по интеграции, потом полчаса вспоминали. Давай в этот раз зафиксируем сразу.

AI-саммари

Фрагмент рабочего созвона: обсуждают сроки по задаче и договариваются, кто отвечает за следующий шаг.

Ручная и автоматическая транскрибация решают одну задачу: превратить запись в текст, с которым можно работать. Разница в том, чем вы за это платите. Типичный файл: час интервью, три спикера, кофейня на фоне, сдать к утру. Речь идёт примерно по 120 слов в минуту, значит в часе записи семь тысяч слов и порядка 45 тысяч знаков, 25 машинописных страниц по 1800 знаков.

Способов ровно три: нейросеть, наёмный расшифровщик и собственная клавиатура. Предел есть у каждого, и проходит он не там, где обещает реклама. Разбираем все три по одним меркам: срок возврата, точность на старте, цена часа записи и время на вычитку, о котором вспоминают последним.

Способ 1. Автоматическая расшифровка нейросетью

Автоматическая расшифровка устроена скучно, и в этом её достоинство: вы загружаете файл и забираете текст быстрее, чем успели бы его прослушать. Скорость мерят через RTF, real-time factor: время обработки делят на длительность записи, и всё ниже единицы быстрее реального времени. Внутри модели запись всё равно режется окнами, у Whisper это 30 секунд. Движки ждут на входе моно 16 кГц, поэтому стерео в 48 кГц добавляет только вес: час такого wav занимает около 690 МБ против 58 МБ у mp3 на 128 кбит/с.

Точность считают через WER, word error rate: сумму замен, пропусков и вставок делят на число слов эталона. Метрика опирается на расстояние Левенштейна (1965), и на совсем плохой записи она уходит выше 100%: вставок бывает больше, чем слов в оригинале. Считают WER на нормализованном тексте, без регистра и знаков препинания, поэтому 7% ошибок по словам ничего не говорят про запятые и абзацы: вычитка расшифровки уходит в основном на оформление. Человек тоже не идеален: на телефонном корпусе Switchboard его расшифровку измеряли примерно в 5,9% ошибок (Microsoft, 2016).

Ломается автоматика на физике записи. Телефония по G.711 оцифровывает голос на 8 кГц и 64 кбит/с в полосе от 300 до 3400 Гц, а 8 кГц дискретизации по теореме Котельникова дают максимум 4 кГц полезной полосы. Шипящие и глухие согласные держат энергию выше этой границы, поэтому «с», «ш» и «ф» в телефонном канале путаются, и апсемплинг их не вернёт. Дистанция так же груба: удвоение расстояния забирает около 6 дБ, петличка в 20 см и смартфон в двух метрах различаются на 20 дБ. Диаризацию, деление реплик по спикерам, мерят метрикой DER, и перекрывающаяся речь бьёт по всем её слагаемым.

Наши цифры для ориентира: WER 7,10% и WAcc 92,9% на бенчмарке из семи датасетов, на телефонном канале 8 кГц около 90%, обработка занимает 1–2% длительности. Принимаем файл или запись с микрофона, не ссылку, поэтому видео скачивают заранее; текст выходит на языке записи. Остальное на странице транскрибация аудио в текст.

Способ 2. Профессиональная расшифровка. Вы покупаете чужие часы

Здесь вы платите за чужое внимание, и вид расшифровки выбирают заранее, их два. Дословная сохраняет всё, включая «э-э», обрывы фраз и повторы, а неразборчивое место помечает как [нрзб] с тайм-кодом. Литературная выпрямляет речь до читаемого текста: в отчёт годится, цитировать по ней рискованно. В техзадании заранее закрывают шаг тайм-кодов и глоссарий имён.

Считают на этом рынке за минуту записи, а не за минуту работы. Цену поднимает не объём, а мутный звук, число спикеров и срочность: «нужно к утру» стоит дороже лишнего получаса чистого разговора. Профессионал держит около четырёх часов работы на час чистой записи, на плохом звуке и при дословном виде ближе к шести.

Особенность рынка: исполнители чаще всего начинают с автопрогона и правят текст, то есть покупаете вы вычитку, а не набор с нуля. Отсюда и слабые места: человек уходит в отпуск и болеет, а ваш дедлайн не двигается. Запись уходит третьему лицу, и если на ней звучат персональные данные, это поручение обработки в смысле статьи 6 152-ФЗ, и оформляется оно договором, а не сообщением в мессенджере.

Живой исполнитель оправдан в двух случаях. Первый: дословность, которую будут оспаривать. В разговорном анализе для этого с 1970-х пользуются нотацией Гейл Джефферсон, где паузы размечают с точностью до 0,1 секунды, а наложения реплик квадратными скобками. Второй случай: пять человек перебивают друг друга под шум кофемашины. Автоматика разложит такое по спикерам с ошибками, а человек догадается по смыслу.

Способ 3. Ручная расшифровка своими руками

Ручная расшифровка проигрывает по арифметике, и арифметика простая. Речь идёт около 120 слов в минуту, уверенный слепой набор даёт 40–60. Семь тысяч слов часовой записи это два-три часа чистого набора, если бы никто не останавливался. Останавливаются все: перемотки, переслушивание одного места трижды, знаки препинания на слух. Отсюда типовые 4–6 часов на час записи.

За речью в реальном времени успевают только стенографы: аккордный набор на стенотипе держит 200 слов в минуту и выше, а пауза и перемотка уходят ножной педали. Остальные приёмы экономят проценты, а не часы. На практике держатся три:

  • замедлить воспроизведение до 0,75, тогда перемоток меньше;
  • не оформлять на ходу. Сначала текст, потом реплики, потом заголовки;
  • взять редактор с горячими клавишами и автоматическим откатом на две-три секунды.

Разумной ручная расшифровка остаётся на коротком и на секретном. Трёхминутную голосовую быстрее разобрать самому, чем открывать сервис. Разговор, который нельзя показывать никому, логично расшифровать лично: это единственный способ, где запись не покидает ваш компьютер.

Сравнение стоимости и времени на часовой записи

Сравнение стоимости и времени становится честным, когда вы считаете полный срок, а не только машинную часть. Полный срок это обработка плюс вычитка, и вычитка есть у всех трёх способов: имена, числа и термины сверяет заказчик. У студийного монолога коэффициент вычитки близок к нулю, у планёрки на громкой связи переваливает за единицу.

Деньги считаются проще. Минута машинной расшифровки стоит доли рубля, у нас от 0,29 ₽, около 17 ₽ за час записи. Минута чужой работы стоит по ставке исполнителя, плюс сутки очереди. Свой час стоит вашей ставки, умноженной на четыре или шесть: при 500 ₽ в час это две-три тысячи недополученной выручки. Бесплатный путь есть: Telegram-бот для расшифровки голосовых @VoicePalatineBot берёт до 100 транскрибаций в день.

Что сравниваемАвтоматическая расшифровкаПрофессиональная расшифровкаРучная расшифровка
Срок на час записиминута обработки (RTF около 0,02) плюс вычиткаот суток, по загрузке4–6 часов вашей работы
Точность на стартеWAcc 92,9%, пунктуация вне метрикипочти дословно, ошибки в терминахпадает к третьему часу
Единица счёта₽ за минуту записиминута записи или страница 1800 знаковваша ставка × 4–6
Кто видит записьоператор сервисаисполнитель и его окружениетолько вы

Одну графу в таблицу не поставить. Ручная расшифровка единственная, где вы платите временем, а не деньгами, и потому кажется бесплатной. Так и расходятся ручная и автоматическая транскрибация: строка бюджета одна, валюта разная.

Что выбрать под конкретную задачу

Выбор упирается в один вопрос: что вы сделаете с текстом дальше. Для поиска по разговору вычитка не нужна вовсе, опечатка не помешает прыгнуть по тайм-коду. Протоколу встречи хватает смысла и правильно написанных имён. Под субтитры берут выгрузку srt или vtt: в SubRip доли секунды отделяются запятой (00:01:12,480), в WebVTT точкой, и первая строка файла обязана быть WEBVTT.

Второй фактор это сроки, которые задаёт не ваш календарь. В гражданском процессе аудиопротоколирование обязательно с 1 сентября 2019 года (ст. 228 ГПК РФ), а замечания на протокол подают в пятидневный срок (ст. 231 ГПК РФ). В это окно исполнитель со сроком «сутки и дольше» помещается один раз, без переделок.

СпособКогда подходитГде ломаетсяЧто на выходе
Автоматическая расшифровкапоток файлов, поиск по записи, протоколы, субтитрыканал 8 кГц, дальний микрофон, наложения репликтекст с тайм-кодами и спикерами, srt или vtt
Профессиональная расшифровкаспор о формулировках, тяжёлый звук, узкие терминычужое расписание, запись на чужом компьютередокумент по шаблону, дословный или литературный
Ручная расшифровказапись до пяти минут, разговор, который нельзя отдаватьвсё длиннее двадцати минуттот текст, что вам нужен, ценой четырёх часов

Третий фактор это объём. Одна запись в месяц живёт в боте, десяток в неделю удобнее гонять через веб-интерфейс, а поток от сотен файлов заводят через speech-to-text API, он принимает файлы и поток по WebSocket, вебхуков нет.

Что выбрать, показывает не сравнительная таблица, включая нашу, а один неудобный файл. Возьмите телефонный разговор, где вас перебивают.

  • прогоните его через автоматическую расшифровку, засеките время;
  • вычитайте первые десять минут текста, глядя на часы;
  • умножьте потраченное на длительность и сравните с четырьмя часами набора.

Коэффициент вычитки и есть ваш ответ. Если он около нуля, автоматика закрывает задачу целиком. Если правка первых десяти минут заняла двадцать, отдать файл человеку выходит дешевле, чем править текст самому.