Hugging Face предложила способ измерять benchmark optimization в распознавании речи и обнаружила неприятный эффект: часть моделей знает правильный ответ для теста лучше, чем слушает запись. Для бизнеса вывод практический. Публичный лидерборд годится для составления шорт-листа, но не для выбора модели без закрытой проверки на собственном аудио.
Что именно нашли
В блоге Hugging Face описаны три теста для выявления benchmark optimization, иногда называемой benchmaxxing. Исследователи проверили 11 широко используемых open-source ASR-моделей на VoxPopuli English и LibriSpeech clean и other.
Несколько моделей с высокими результатами воспроизводили эталонные транскрипты, когда те противоречили аудио. Поведение сохранялось, если значимые слова заглушали, а иногда модель, по оценке исследователей, ориентировалась на акустические признаки, указывающие, к какому бенчмарку относится запись.
Показательный пример взят из VoxPopuli. В клипе слышно «Thank you, Mr. President», но в эталонном транскрипте пропущено «Thank you». Шесть из 11 моделей повторили ошибочную версию. Более того, модели, пропустившие слышимую фразу, воспроизвели и характерное для референса оформление «Mr» без точки.
Когда ту же реплику озвучивали новыми голосами из записей Европарламента или обычными синтетическими голосами, эффект ослабевал или исчезал. На generic TTS-версии все 11 моделей вернули пропущенную в референсе вежливость. Это не доказывает конкретный механизм обучения каждой модели, но показывает сам риск: ответ может зависеть не только от произнесённых слов, но и от узнаваемости тестового материала.
Масштаб тоже нельзя списать на один забавный клип. Метод Hugging Face отметил потенциальные ошибки референса в 40% проанализированных тестовых записей VoxPopuli, затрагивающие около 3% всех слов. Модели с benchmark-optimized поведением повторяли ошибочные транскрипты в 18–30% таких случаев. При этом системы с более низким WER на VoxPopuli чаще воспроизводили ошибки эталона.
В другой проверке исследователи заглушали числа. Корректная модель не должна выводить число, которого нет в аудио. Однако некоторые системы восстанавливали именно текст из референса, включая относительно случайный год 2011.
Почему низкий WER теперь недостаточен
WER отвечает на узкий вопрос: насколько вывод модели совпал с выбранным эталонным текстом. Если сам эталон ошибочен, модель получает штраф за верную расшифровку и награду за повторение ошибки. Лидерборд в такой ситуации измеряет не только распознавание речи, но и способность попасть в ожидания конкретного набора.
Для команды, которая выбирает ASR для продукта, это меняет роль рейтинга. Разница между двумя моделями в публичной таблице не обязана превращаться в такую же разницу на звонках клиентов, записях встреч или голосовых сообщениях. Особенно осторожно стоит обращаться с переносом результатов на другой язык: исследование Hugging Face касается английских наборов VoxPopuli и LibriSpeech, поэтому само по себе ничего не доказывает о качестве тех же моделей на русском аудио.
Покупать по лидерборду здесь примерно то же самое, что нанимать оператора колл-центра по знанию ответов на экзаменационные билеты. Результат может быть отличным, пока клиент говорит словами из билета.
Как перепроверить шорт-лист
Практический минимум состоит из двух частей. Первая: закрытый набор реальных записей, который не публиковался и не мог превратиться в узнаваемый тест. Вторая: проверки на устойчивость. Можно менять голос при сохранении текста, заглушать отдельные слова и числа, а затем смотреть, продолжает ли модель слышать отсутствующий фрагмент.
Полезно отдельно разбирать случаи, где несколько независимых моделей не согласны с референсом. Hugging Face использовала ансамбль систем с низким phoneme error rate, чтобы находить такие расхождения, а затем проверяла выборку человеческой разметкой. Для продуктовой команды смысл подхода не в копировании всей исследовательской установки, а в отказе считать референс непогрешимым.
Главный маркер на следующем прогоне прост: сохраняется ли порядок моделей после теста на закрытых записях и их изменённых версиях. Если лидер публичного рейтинга начинает восстанавливать заглушённые слова или резко теряет преимущество на новых голосах, вы сравнивали не качество ASR для продукта, а степень знакомства моделей с экзаменом.