К содержанию
Новости

Исследование arXiv описало накопление ошибок в оценке agentic AI-систем

Инфографика: 82% исследований с проблемами IRR
Графика: hegai.media

Исследователи опубликовали анализ методов оценки agentic AI-систем и пришли к выводу, что результаты популярных автоматизированных бенчмарков могут быть менее надёжными, чем принято считать. В работе разбираются три уровня проблем: генерация задач, симуляция пользователей и проверка ответов.

Как пишет arXiv cs.AI (Artificial Intelligence), авторы изучили десять популярных бенчмарков. Проблемы с валидностью обнаружились в семи из них, а пробелы в отчётности, во всех десяти. Исследование также показывает, что замена реальных пользователей LLM-симуляторами вносит дополнительные искажения. В калибровочных исследованиях различия между симуляторами достигали 9 процентных пунктов, особенно в случаях с пользователями, говорящими не на Standard American English.

Авторы отдельно проанализировали 55 научных работ. По их выводам, около 82% исследований используют структурно несоответствующие, неполные или вовсе отсутствующие метрики IRR. Исследователи считают, что ошибки на разных этапах не просто суммируются, а усиливают друг друга. В качестве примера они описывают сценарий, в котором система сохраняет 70% корректного сигнала при генерации задач, 80% на этапе симуляции и 65% при оценке результатов. В этом случае итоговая валидность составляет не более 36% относительно исходной цели измерения.

Ключевые факты

  • В аудите десяти популярных бенчмарков проблемы с валидностью нашли в семи, а пробелы в отчётности, во всех десяти

  • Калибровочные исследования показали расхождение между LLM-симуляторами до 9 процентных пунктов

  • Структурный обзор 55 научных работ показал, что около 82% используют некорректные, неполные или отсутствующие метрики IRR

  • Авторы привели пример пайплайна с сохранением 70%, 80% и 65% сигнала на разных этапах, где итоговая валидность не превышает 36%

Вопросы и ответы

Почему результаты agentic AI-бенчмарков могут выглядеть точнее, чем они есть на практике?

Исследование описывает накопление ошибок между этапами оценки. В примере авторов пайплайн сохраняет 70% сигнала при генерации задач, 80% при симуляции пользователей и 65% при проверке ответов, но итоговая валидность падает до 36% от исходной цели измерения.

Насколько серьёзны проблемы в популярных системах оценки agentic AI?

В аудите десяти популярных бенчмарков проблемы с валидностью нашли в семи, а пробелы в отчётности обнаружили во всех десяти. Авторы считают, что это снижает надёжность автоматизированных оценок, на которые ориентируются разработчики и исследователи.

Что исследование говорит о замене реальных пользователей LLM-симуляторами?

Калибровочные исследования показали расхождение между LLM-симуляторами до 9 процентных пунктов. Наибольшие различия наблюдались для пользователей, говорящих не на Standard American English.

Контекст по теме