Транскрибация для HR это перевод записей собеседований, вводных встреч и exit-интервью в текст с делением на спикеров и тайм-кодами. Арифметика простая: 20 собеседований в неделю по 40 минут дают больше 13 часов чужой речи. Разговорная речь идёт по 100–130 слов в минуту, так что час интервью это 6–7 тысяч слов, около 40 тысяч знаков, больше 20 страниц по 1800 знаков. Пока рекрутер пишет в блокнот, он наполовину выпадает из разговора; если не пишет, к пятнице от вторничного кандидата остаётся общее ощущение без формулировок.
Мы делаем сервис распознавания речи и дальше разбираем по этапам найма: где расшифровка собеседования экономит время, а где текст мешает.
Где расшифровка встраивается в работу HR
Ценность текста меняется от этапа к этапу. Пятнадцатиминутный скрининг проводят ради четырёх фактов: вилка, сроки выхода, стоп-факторы, город. Полная расшифровка тут скорее мешает: четыре строки в карточке закрывают ту же задачу быстрее, чем страница диалога. Мешает и канал: телефония передаёт полосу 300–3400 Гц при дискретизации 8 кГц и кодеке G.711, всё выше 4 кГц срезано, а там энергия шипящих и звука «ф», по которым различаются похожие фамилии.
Часовое интервью с кандидатом устроено иначе, здесь дословность окупается. Структурированное интервью держится на одинаковых вопросах в одном порядке: в обзоре Кэмпиона, Палмера и Кэмпиона (1997) структура разложена на 15 элементов, а в метаанализе Шмидта и Хантера (1998) её валидность оценена коэффициентом около 0,51 против 0,38 у свободной беседы. Ответ по схеме STAR (ситуация, задача, действие, результат) занимает 2–3 минуты, и важно, что кандидат назвал своим действием, а что действием команды. Пересказ по памяти через неделю стирает эту границу первой, поэтому транскрибация для рекрутеров окупается именно здесь.
Есть и обратная сторона. На массовом найме, где решают город и график смен, 40 звонков в день превращать в текст бессмысленно: по 5 минут каждый это больше 3 часов записи, а анкета с закрытыми ответами быстрее. И расшифровка не заменяет структуру: текст свободной беседы это аккуратная запись слабого инструмента.
| Этап | Длительность | Когда текст нужен | Где ломается | Что в карточку |
|---|---|---|---|---|
| Скрининг по телефону | 10–15 мин | почти никогда | полоса 8 кГц, шум улицы | 4 строки фактов |
| Интервью с кандидатом | 40–60 мин | основной сценарий | фамилии, бренды | 4–5 цитат с тайм-кодами |
| Техническое интервью | 60–90 мин | решение спорное | аббревиатуры, имена библиотек | ход рассуждения |
| Финал с нанимающим | 30–40 мин | торгуются по вилке | трое в комнате, перебивания | грейд, вилка, дата выхода |
| Exit-интервью | 30–40 мин | с оговоркой, см. ниже | запись меняет откровенность | обезличенная причина |
Расшифровка собеседования: от скрининга до финала
Расшифровка собеседования приходит текстом с тайм-кодами и делением на спикеров: видно, на какой минуте прозвучала вилка и кто её назвал. Точность считают через WER: доля подстановок, пропусков и вставок к числу слов эталона. На бенчмарке из 7 датасетов у нас WAcc 92,9%, на телефонной дорожке 8 кГц около 90%. Обработка занимает 1–2% длительности, час разговора готов за минуту, цена от 0,29 ₽/мин. Принимаем файл или запись с микрофона, ссылку на облачную запись вставить нельзя. Остальное на странице транскрибация интервью.
Возня с файлами начинается раньше распознавания. Zoom при локальной записи раскладывает встречу на видео и дорожку audio_only.m4a, грузить стоит её. Google Meet кладёт на Диск mp4, звук вынимают командой вида ffmpeg -i meet.mp4 -vn -c:a copy audio.m4a, которая ничего не перекодирует. Голосовое из Telegram приходит в ogg с кодеком Opus, диктофон iPhone пишет m4a, а старые Android-приложения до сих пор используют AMR: 8 кГц и до 12,2 кбит/с, такой файл лучше пересобрать в wav 16 кГц.
| Способ фиксации | Когда подходит | Где ломается | Что на выходе |
|---|---|---|---|
| Заметки в блокноте | 1 интервьюер, спокойный темп | слушаете вполовину | 5–10 своих фраз |
| Аудио без текста | архив на случай спора | час не пролистать глазами | файл, который не открывают |
| Текст с тайм-кодами | панель из 3 человек | фамилии сверяют глазами | цитаты и поиск по словам |
Адаптация, 1:1 и exit-интервью
Работа с человеком не заканчивается оффером. Испытательный срок по Трудовому кодексу длится до 3 месяцев, для руководителей и главных бухгалтеров до 6, а решение складывается из первых недель. За час вводной встречи на новичка вываливают двадцать имён и пять систем, а рабочая память держит 7 плюс-минус 2 элемента (Миллер, 1956), в более поздних оценках ближе к 4 (Кован, 2001). Текст этой встречи снимает часть повторных вопросов: через две недели новичок ищет в нём слово «доступ», а не пишет в общий чат.
Регулярные 1:1 дают отложенный эффект. Обычный ритм это 30 минут раз в 1–2 недели, за год с одним человеком набегает больше 20 разговоров. Через полгода сотрудник вспоминает разговор про переход в тимлиды, а руководитель помнит иначе, и запись с тайм-кодом закрывает спор за пару минут. Тут выручает транскрибация встреч и совещаний: в тексте видно, что обещали и с какой оговоркой.
С exit-интервью сложнее. Окно короткое: по собственному желанию предупреждают за 2 недели, и разговор об уходе попадает в эти 14 календарных дней. Люди говорят осторожнее, когда знают про запись, и польза тут не в дословной цитате, а в накопленной за квартал картине причин: диктофон разумнее выключить.
Как работать с текстом после расшифровки
Сырой текст ещё не документ. Расшифровка интервью с кандидатом на час разговора это 20 с лишним страниц, и в карточку их целиком не кладут. Перепечатывать руками тоже не вариант: при уверенных 200 знаках в минуту 40 тысяч знаков это больше 3 часов печати. Работает короткая выжимка с цитатами, сделанная в тот же день: кривая забывания Эббингауза (1885) круче всего падает в первые часы.
- пройтись поиском по опорным словам («зарплат», «оффер», «уволил», «срок»);
- вытащить 4–5 цитат с тайм-кодами в оценочную форму под компетенции;
- поставить балл по шкале с поведенческими якорями (Смит и Кендалл, 1963), а не по впечатлению;
- сверить глазами фамилии и бренды, а текст положить рядом с карточкой, не в личные заметки.
Ошибки распознавания предсказуемы, и проверять стоит именно их: фамилии, бренды, редкие аббревиатуры и узкие термины. Диаризация путается на перекрытии речи, поэтому в её оценке границы реплик сверяют с допуском около 250 мс. Микрофон решает не меньше: при удвоении расстояния до говорящего звуковое давление падает примерно на 6 дБ, поэтому ноутбук на краю стола берёт голос тише гарнитуры в 15–20 сантиметрах и добирает эхо. На таком сигнале проседает любой движок, наш в том числе, так что звук проверьте заранее: транскрибация бесплатно идёт через бот @VoicePalatineBot, до 100 транскрибаций в день.
Командная работа: рекрутер, нанимающий менеджер, ATS
Больше всего текст даёт тому, кто на интервью не был. Нанимающий менеджер редко смотрит часовую запись целиком, а страницу с 5 цитатами и тайм-кодами читает за 2 минуты: спор идёт про сказанное на встрече, а не про общее впечатление.
Второй сценарий это калибровка команды найма. Эффект ореола, описанный Торндайком в 1920 году, работает и на панели интервьюеров: одна яркая черта тянет за собой оценки по остальным компетенциям. Сравнивать оценки есть смысл только на одном материале, а не на двух разных фрагментах разговора.
В ATS текст забирают через API с опросом статуса, вебхуков нет. Через 100 интервью найти нужную запись поможет только договорённость об имени файла: дата, вакансия, кандидат, этап.
Согласие, хранение и то, чего сервис не делает
Согласие на запись проще всего проговорить голосом в первые 30 секунд встречи: что пишем, зачем, кто получит доступ, сколько текст хранится. Закон требует, чтобы согласие было конкретным, информированным и сознательным; эти четыре пункта его такими и делают, а сказанное голосом остаётся внутри записи. Отказы бывают: такое интервью проводят с блокнотом.
Вопросы службы безопасности упираются в хранение, и тут помогают два решения. Первое это срок: текст живёт, пока открыта вакансия и идёт испытательный срок, потом его обезличивают или удаляют. Второе это доступ по этапам: exit-интервью не отдают прямому руководителю ушедшего, иначе следующий разговор будет пустым. Данные обрабатываем по 152-ФЗ и держим в России, на записях клиентов модели не обучаем.
Границы технологии лучше назвать сразу. Распознавание речи возвращает слова и разметку по спикерам, но мотивацию по интонации не измеряет и балл не выставляет: вывод о человеке делает интервьюер. Перевода на другой язык нет: собеседование на казахском останется казахским.
Возьмите ближайшее собеседование в календаре: предупредите кандидата, включите запись, скачайте звуковую дорожку, загрузите файл. Через минуту будет текст. Прочитайте его на следующий день рядом со своим фидбэком по памяти: расхождение покажет, какую часть разговора вы теряете.