Транскрибация для HR: собеседования, адаптация, оценка

Перетащите аудио или видео или нажмите, чтобы выбратьMP3 · WAV · M4A · OGG · MP4 · до 30 минут
Пример результата – так выглядит готовая расшифровка
00:47РусскийСпикеры: 2
00:00Спикер 1

Давай коротко по срокам. Мы успеваем к пятнице или переносим на следующую неделю?

00:07Спикер 2

К пятнице успеваем, если макеты придут завтра. Если позже, то реалистичнее вторник, и это я ещё не закладываю правки после ревью.

00:18Спикер 1

Понял. Тогда я тереблю дизайн сегодня, а ты пока начинаешь с той части, которая от макетов не зависит.

00:25Спикер 2

Договорились. И ещё момент: на прошлой неделе мы забыли записать решение по интеграции, потом полчаса вспоминали. Давай в этот раз зафиксируем сразу.

AI-саммари

Фрагмент рабочего созвона: обсуждают сроки по задаче и договариваются, кто отвечает за следующий шаг.

Транскрибация для HR это перевод записей собеседований, вводных встреч и exit-интервью в текст с делением на спикеров и тайм-кодами. Арифметика простая: 20 собеседований в неделю по 40 минут дают больше 13 часов чужой речи. Разговорная речь идёт по 100–130 слов в минуту, так что час интервью это 6–7 тысяч слов, около 40 тысяч знаков, больше 20 страниц по 1800 знаков. Пока рекрутер пишет в блокнот, он наполовину выпадает из разговора; если не пишет, к пятнице от вторничного кандидата остаётся общее ощущение без формулировок.

Мы делаем сервис распознавания речи и дальше разбираем по этапам найма: где расшифровка собеседования экономит время, а где текст мешает.

Где расшифровка встраивается в работу HR

Ценность текста меняется от этапа к этапу. Пятнадцатиминутный скрининг проводят ради четырёх фактов: вилка, сроки выхода, стоп-факторы, город. Полная расшифровка тут скорее мешает: четыре строки в карточке закрывают ту же задачу быстрее, чем страница диалога. Мешает и канал: телефония передаёт полосу 300–3400 Гц при дискретизации 8 кГц и кодеке G.711, всё выше 4 кГц срезано, а там энергия шипящих и звука «ф», по которым различаются похожие фамилии.

Часовое интервью с кандидатом устроено иначе, здесь дословность окупается. Структурированное интервью держится на одинаковых вопросах в одном порядке: в обзоре Кэмпиона, Палмера и Кэмпиона (1997) структура разложена на 15 элементов, а в метаанализе Шмидта и Хантера (1998) её валидность оценена коэффициентом около 0,51 против 0,38 у свободной беседы. Ответ по схеме STAR (ситуация, задача, действие, результат) занимает 2–3 минуты, и важно, что кандидат назвал своим действием, а что действием команды. Пересказ по памяти через неделю стирает эту границу первой, поэтому транскрибация для рекрутеров окупается именно здесь.

Есть и обратная сторона. На массовом найме, где решают город и график смен, 40 звонков в день превращать в текст бессмысленно: по 5 минут каждый это больше 3 часов записи, а анкета с закрытыми ответами быстрее. И расшифровка не заменяет структуру: текст свободной беседы это аккуратная запись слабого инструмента.

ЭтапДлительностьКогда текст нуженГде ломаетсяЧто в карточку
Скрининг по телефону10–15 минпочти никогдаполоса 8 кГц, шум улицы4 строки фактов
Интервью с кандидатом40–60 миносновной сценарийфамилии, бренды4–5 цитат с тайм-кодами
Техническое интервью60–90 минрешение спорноеаббревиатуры, имена библиотекход рассуждения
Финал с нанимающим30–40 минторгуются по вилкетрое в комнате, перебиваниягрейд, вилка, дата выхода
Exit-интервью30–40 минс оговоркой, см. нижезапись меняет откровенностьобезличенная причина

Расшифровка собеседования: от скрининга до финала

Расшифровка собеседования приходит текстом с тайм-кодами и делением на спикеров: видно, на какой минуте прозвучала вилка и кто её назвал. Точность считают через WER: доля подстановок, пропусков и вставок к числу слов эталона. На бенчмарке из 7 датасетов у нас WAcc 92,9%, на телефонной дорожке 8 кГц около 90%. Обработка занимает 1–2% длительности, час разговора готов за минуту, цена от 0,29 ₽/мин. Принимаем файл или запись с микрофона, ссылку на облачную запись вставить нельзя. Остальное на странице транскрибация интервью.

Возня с файлами начинается раньше распознавания. Zoom при локальной записи раскладывает встречу на видео и дорожку audio_only.m4a, грузить стоит её. Google Meet кладёт на Диск mp4, звук вынимают командой вида ffmpeg -i meet.mp4 -vn -c:a copy audio.m4a, которая ничего не перекодирует. Голосовое из Telegram приходит в ogg с кодеком Opus, диктофон iPhone пишет m4a, а старые Android-приложения до сих пор используют AMR: 8 кГц и до 12,2 кбит/с, такой файл лучше пересобрать в wav 16 кГц.

Способ фиксацииКогда подходитГде ломаетсяЧто на выходе
Заметки в блокноте1 интервьюер, спокойный темпслушаете вполовину5–10 своих фраз
Аудио без текстаархив на случай спорачас не пролистать глазамифайл, который не открывают
Текст с тайм-кодамипанель из 3 человекфамилии сверяют глазамицитаты и поиск по словам

Адаптация, 1:1 и exit-интервью

Работа с человеком не заканчивается оффером. Испытательный срок по Трудовому кодексу длится до 3 месяцев, для руководителей и главных бухгалтеров до 6, а решение складывается из первых недель. За час вводной встречи на новичка вываливают двадцать имён и пять систем, а рабочая память держит 7 плюс-минус 2 элемента (Миллер, 1956), в более поздних оценках ближе к 4 (Кован, 2001). Текст этой встречи снимает часть повторных вопросов: через две недели новичок ищет в нём слово «доступ», а не пишет в общий чат.

Регулярные 1:1 дают отложенный эффект. Обычный ритм это 30 минут раз в 1–2 недели, за год с одним человеком набегает больше 20 разговоров. Через полгода сотрудник вспоминает разговор про переход в тимлиды, а руководитель помнит иначе, и запись с тайм-кодом закрывает спор за пару минут. Тут выручает транскрибация встреч и совещаний: в тексте видно, что обещали и с какой оговоркой.

С exit-интервью сложнее. Окно короткое: по собственному желанию предупреждают за 2 недели, и разговор об уходе попадает в эти 14 календарных дней. Люди говорят осторожнее, когда знают про запись, и польза тут не в дословной цитате, а в накопленной за квартал картине причин: диктофон разумнее выключить.

Как работать с текстом после расшифровки

Сырой текст ещё не документ. Расшифровка интервью с кандидатом на час разговора это 20 с лишним страниц, и в карточку их целиком не кладут. Перепечатывать руками тоже не вариант: при уверенных 200 знаках в минуту 40 тысяч знаков это больше 3 часов печати. Работает короткая выжимка с цитатами, сделанная в тот же день: кривая забывания Эббингауза (1885) круче всего падает в первые часы.

  • пройтись поиском по опорным словам («зарплат», «оффер», «уволил», «срок»);
  • вытащить 4–5 цитат с тайм-кодами в оценочную форму под компетенции;
  • поставить балл по шкале с поведенческими якорями (Смит и Кендалл, 1963), а не по впечатлению;
  • сверить глазами фамилии и бренды, а текст положить рядом с карточкой, не в личные заметки.

Ошибки распознавания предсказуемы, и проверять стоит именно их: фамилии, бренды, редкие аббревиатуры и узкие термины. Диаризация путается на перекрытии речи, поэтому в её оценке границы реплик сверяют с допуском около 250 мс. Микрофон решает не меньше: при удвоении расстояния до говорящего звуковое давление падает примерно на 6 дБ, поэтому ноутбук на краю стола берёт голос тише гарнитуры в 15–20 сантиметрах и добирает эхо. На таком сигнале проседает любой движок, наш в том числе, так что звук проверьте заранее: транскрибация бесплатно идёт через бот @VoicePalatineBot, до 100 транскрибаций в день.

Командная работа: рекрутер, нанимающий менеджер, ATS

Больше всего текст даёт тому, кто на интервью не был. Нанимающий менеджер редко смотрит часовую запись целиком, а страницу с 5 цитатами и тайм-кодами читает за 2 минуты: спор идёт про сказанное на встрече, а не про общее впечатление.

Второй сценарий это калибровка команды найма. Эффект ореола, описанный Торндайком в 1920 году, работает и на панели интервьюеров: одна яркая черта тянет за собой оценки по остальным компетенциям. Сравнивать оценки есть смысл только на одном материале, а не на двух разных фрагментах разговора.

В ATS текст забирают через API с опросом статуса, вебхуков нет. Через 100 интервью найти нужную запись поможет только договорённость об имени файла: дата, вакансия, кандидат, этап.

Согласие, хранение и то, чего сервис не делает

Согласие на запись проще всего проговорить голосом в первые 30 секунд встречи: что пишем, зачем, кто получит доступ, сколько текст хранится. Закон требует, чтобы согласие было конкретным, информированным и сознательным; эти четыре пункта его такими и делают, а сказанное голосом остаётся внутри записи. Отказы бывают: такое интервью проводят с блокнотом.

Вопросы службы безопасности упираются в хранение, и тут помогают два решения. Первое это срок: текст живёт, пока открыта вакансия и идёт испытательный срок, потом его обезличивают или удаляют. Второе это доступ по этапам: exit-интервью не отдают прямому руководителю ушедшего, иначе следующий разговор будет пустым. Данные обрабатываем по 152-ФЗ и держим в России, на записях клиентов модели не обучаем.

Границы технологии лучше назвать сразу. Распознавание речи возвращает слова и разметку по спикерам, но мотивацию по интонации не измеряет и балл не выставляет: вывод о человеке делает интервьюер. Перевода на другой язык нет: собеседование на казахском останется казахским.

Возьмите ближайшее собеседование в календаре: предупредите кандидата, включите запись, скачайте звуковую дорожку, загрузите файл. Через минуту будет текст. Прочитайте его на следующий день рядом со своим фидбэком по памяти: расхождение покажет, какую часть разговора вы теряете.