Ручная и автоматическая транскрибация решают одну задачу: превратить запись в текст, с которым можно работать. Разница в том, чем вы за это платите. Типичный файл: час интервью, три спикера, кофейня на фоне, сдать к утру. Речь идёт примерно по 120 слов в минуту, значит в часе записи семь тысяч слов и порядка 45 тысяч знаков, 25 машинописных страниц по 1800 знаков.
Способов ровно три: нейросеть, наёмный расшифровщик и собственная клавиатура. Предел есть у каждого, и проходит он не там, где обещает реклама. Разбираем все три по одним меркам: срок возврата, точность на старте, цена часа записи и время на вычитку, о котором вспоминают последним.
Способ 1. Автоматическая расшифровка нейросетью
Автоматическая расшифровка устроена скучно, и в этом её достоинство: вы загружаете файл и забираете текст быстрее, чем успели бы его прослушать. Скорость мерят через RTF, real-time factor: время обработки делят на длительность записи, и всё ниже единицы быстрее реального времени. Внутри модели запись всё равно режется окнами, у Whisper это 30 секунд. Движки ждут на входе моно 16 кГц, поэтому стерео в 48 кГц добавляет только вес: час такого wav занимает около 690 МБ против 58 МБ у mp3 на 128 кбит/с.
Точность считают через WER, word error rate: сумму замен, пропусков и вставок делят на число слов эталона. Метрика опирается на расстояние Левенштейна (1965), и на совсем плохой записи она уходит выше 100%: вставок бывает больше, чем слов в оригинале. Считают WER на нормализованном тексте, без регистра и знаков препинания, поэтому 7% ошибок по словам ничего не говорят про запятые и абзацы: вычитка расшифровки уходит в основном на оформление. Человек тоже не идеален: на телефонном корпусе Switchboard его расшифровку измеряли примерно в 5,9% ошибок (Microsoft, 2016).
Ломается автоматика на физике записи. Телефония по G.711 оцифровывает голос на 8 кГц и 64 кбит/с в полосе от 300 до 3400 Гц, а 8 кГц дискретизации по теореме Котельникова дают максимум 4 кГц полезной полосы. Шипящие и глухие согласные держат энергию выше этой границы, поэтому «с», «ш» и «ф» в телефонном канале путаются, и апсемплинг их не вернёт. Дистанция так же груба: удвоение расстояния забирает около 6 дБ, петличка в 20 см и смартфон в двух метрах различаются на 20 дБ. Диаризацию, деление реплик по спикерам, мерят метрикой DER, и перекрывающаяся речь бьёт по всем её слагаемым.
Наши цифры для ориентира: WER 7,10% и WAcc 92,9% на бенчмарке из семи датасетов, на телефонном канале 8 кГц около 90%, обработка занимает 1–2% длительности. Принимаем файл или запись с микрофона, не ссылку, поэтому видео скачивают заранее; текст выходит на языке записи. Остальное на странице транскрибация аудио в текст.
Способ 2. Профессиональная расшифровка. Вы покупаете чужие часы
Здесь вы платите за чужое внимание, и вид расшифровки выбирают заранее, их два. Дословная сохраняет всё, включая «э-э», обрывы фраз и повторы, а неразборчивое место помечает как [нрзб] с тайм-кодом. Литературная выпрямляет речь до читаемого текста: в отчёт годится, цитировать по ней рискованно. В техзадании заранее закрывают шаг тайм-кодов и глоссарий имён.
Считают на этом рынке за минуту записи, а не за минуту работы. Цену поднимает не объём, а мутный звук, число спикеров и срочность: «нужно к утру» стоит дороже лишнего получаса чистого разговора. Профессионал держит около четырёх часов работы на час чистой записи, на плохом звуке и при дословном виде ближе к шести.
Особенность рынка: исполнители чаще всего начинают с автопрогона и правят текст, то есть покупаете вы вычитку, а не набор с нуля. Отсюда и слабые места: человек уходит в отпуск и болеет, а ваш дедлайн не двигается. Запись уходит третьему лицу, и если на ней звучат персональные данные, это поручение обработки в смысле статьи 6 152-ФЗ, и оформляется оно договором, а не сообщением в мессенджере.
Живой исполнитель оправдан в двух случаях. Первый: дословность, которую будут оспаривать. В разговорном анализе для этого с 1970-х пользуются нотацией Гейл Джефферсон, где паузы размечают с точностью до 0,1 секунды, а наложения реплик квадратными скобками. Второй случай: пять человек перебивают друг друга под шум кофемашины. Автоматика разложит такое по спикерам с ошибками, а человек догадается по смыслу.
Способ 3. Ручная расшифровка своими руками
Ручная расшифровка проигрывает по арифметике, и арифметика простая. Речь идёт около 120 слов в минуту, уверенный слепой набор даёт 40–60. Семь тысяч слов часовой записи это два-три часа чистого набора, если бы никто не останавливался. Останавливаются все: перемотки, переслушивание одного места трижды, знаки препинания на слух. Отсюда типовые 4–6 часов на час записи.
За речью в реальном времени успевают только стенографы: аккордный набор на стенотипе держит 200 слов в минуту и выше, а пауза и перемотка уходят ножной педали. Остальные приёмы экономят проценты, а не часы. На практике держатся три:
- замедлить воспроизведение до 0,75, тогда перемоток меньше;
- не оформлять на ходу. Сначала текст, потом реплики, потом заголовки;
- взять редактор с горячими клавишами и автоматическим откатом на две-три секунды.
Разумной ручная расшифровка остаётся на коротком и на секретном. Трёхминутную голосовую быстрее разобрать самому, чем открывать сервис. Разговор, который нельзя показывать никому, логично расшифровать лично: это единственный способ, где запись не покидает ваш компьютер.
Сравнение стоимости и времени на часовой записи
Сравнение стоимости и времени становится честным, когда вы считаете полный срок, а не только машинную часть. Полный срок это обработка плюс вычитка, и вычитка есть у всех трёх способов: имена, числа и термины сверяет заказчик. У студийного монолога коэффициент вычитки близок к нулю, у планёрки на громкой связи переваливает за единицу.
Деньги считаются проще. Минута машинной расшифровки стоит доли рубля, у нас от 0,29 ₽, около 17 ₽ за час записи. Минута чужой работы стоит по ставке исполнителя, плюс сутки очереди. Свой час стоит вашей ставки, умноженной на четыре или шесть: при 500 ₽ в час это две-три тысячи недополученной выручки. Бесплатный путь есть: Telegram-бот для расшифровки голосовых @VoicePalatineBot берёт до 100 транскрибаций в день.
| Что сравниваем | Автоматическая расшифровка | Профессиональная расшифровка | Ручная расшифровка |
|---|---|---|---|
| Срок на час записи | минута обработки (RTF около 0,02) плюс вычитка | от суток, по загрузке | 4–6 часов вашей работы |
| Точность на старте | WAcc 92,9%, пунктуация вне метрики | почти дословно, ошибки в терминах | падает к третьему часу |
| Единица счёта | ₽ за минуту записи | минута записи или страница 1800 знаков | ваша ставка × 4–6 |
| Кто видит запись | оператор сервиса | исполнитель и его окружение | только вы |
Одну графу в таблицу не поставить. Ручная расшифровка единственная, где вы платите временем, а не деньгами, и потому кажется бесплатной. Так и расходятся ручная и автоматическая транскрибация: строка бюджета одна, валюта разная.
Что выбрать под конкретную задачу
Выбор упирается в один вопрос: что вы сделаете с текстом дальше. Для поиска по разговору вычитка не нужна вовсе, опечатка не помешает прыгнуть по тайм-коду. Протоколу встречи хватает смысла и правильно написанных имён. Под субтитры берут выгрузку srt или vtt: в SubRip доли секунды отделяются запятой (00:01:12,480), в WebVTT точкой, и первая строка файла обязана быть WEBVTT.
Второй фактор это сроки, которые задаёт не ваш календарь. В гражданском процессе аудиопротоколирование обязательно с 1 сентября 2019 года (ст. 228 ГПК РФ), а замечания на протокол подают в пятидневный срок (ст. 231 ГПК РФ). В это окно исполнитель со сроком «сутки и дольше» помещается один раз, без переделок.
| Способ | Когда подходит | Где ломается | Что на выходе |
|---|---|---|---|
| Автоматическая расшифровка | поток файлов, поиск по записи, протоколы, субтитры | канал 8 кГц, дальний микрофон, наложения реплик | текст с тайм-кодами и спикерами, srt или vtt |
| Профессиональная расшифровка | спор о формулировках, тяжёлый звук, узкие термины | чужое расписание, запись на чужом компьютере | документ по шаблону, дословный или литературный |
| Ручная расшифровка | запись до пяти минут, разговор, который нельзя отдавать | всё длиннее двадцати минут | тот текст, что вам нужен, ценой четырёх часов |
Третий фактор это объём. Одна запись в месяц живёт в боте, десяток в неделю удобнее гонять через веб-интерфейс, а поток от сотен файлов заводят через speech-to-text API, он принимает файлы и поток по WebSocket, вебхуков нет.
Что выбрать, показывает не сравнительная таблица, включая нашу, а один неудобный файл. Возьмите телефонный разговор, где вас перебивают.
- прогоните его через автоматическую расшифровку, засеките время;
- вычитайте первые десять минут текста, глядя на часы;
- умножьте потраченное на длительность и сравните с четырьмя часами набора.
Коэффициент вычитки и есть ваш ответ. Если он около нуля, автоматика закрывает задачу целиком. Если правка первых десяти минут заняла двадцать, отдать файл человеку выходит дешевле, чем править текст самому.