Исследование arXiv описало накопление ошибок в оценке agentic AI-систем

Исследователи опубликовали анализ методов оценки agentic AI-систем и пришли к выводу, что результаты популярных автоматизированных бенчмарков могут быть менее надёжными, чем принято считать. В работе разбираются три уровня проблем: генерация задач, симуляция пользователей и проверка ответов.
Как пишет arXiv cs.AI (Artificial Intelligence), авторы изучили десять популярных бенчмарков. Проблемы с валидностью обнаружились в семи из них, а пробелы в отчётности, во всех десяти. Исследование также показывает, что замена реальных пользователей LLM-симуляторами вносит дополнительные искажения. В калибровочных исследованиях различия между симуляторами достигали 9 процентных пунктов, особенно в случаях с пользователями, говорящими не на Standard American English.
Авторы отдельно проанализировали 55 научных работ. По их выводам, около 82% исследований используют структурно несоответствующие, неполные или вовсе отсутствующие метрики IRR. Исследователи считают, что ошибки на разных этапах не просто суммируются, а усиливают друг друга. В качестве примера они описывают сценарий, в котором система сохраняет 70% корректного сигнала при генерации задач, 80% на этапе симуляции и 65% при оценке результатов. В этом случае итоговая валидность составляет не более 36% относительно исходной цели измерения.
Ключевые факты
В аудите десяти популярных бенчмарков проблемы с валидностью нашли в семи, а пробелы в отчётности, во всех десяти
Калибровочные исследования показали расхождение между LLM-симуляторами до 9 процентных пунктов
Структурный обзор 55 научных работ показал, что около 82% используют некорректные, неполные или отсутствующие метрики IRR
Авторы привели пример пайплайна с сохранением 70%, 80% и 65% сигнала на разных этапах, где итоговая валидность не превышает 36%
Вопросы и ответы
- Почему результаты agentic AI-бенчмарков могут выглядеть точнее, чем они есть на практике?
Исследование описывает накопление ошибок между этапами оценки. В примере авторов пайплайн сохраняет 70% сигнала при генерации задач, 80% при симуляции пользователей и 65% при проверке ответов, но итоговая валидность падает до 36% от исходной цели измерения.
- Насколько серьёзны проблемы в популярных системах оценки agentic AI?
В аудите десяти популярных бенчмарков проблемы с валидностью нашли в семи, а пробелы в отчётности обнаружили во всех десяти. Авторы считают, что это снижает надёжность автоматизированных оценок, на которые ориентируются разработчики и исследователи.
- Что исследование говорит о замене реальных пользователей LLM-симуляторами?
Калибровочные исследования показали расхождение между LLM-симуляторами до 9 процентных пунктов. Наибольшие различия наблюдались для пользователей, говорящих не на Standard American English.
Контекст по теме
- AgentSLABench предложил оценивать ИИ-агентов с учётом затрат ресурсов4 августа 2026 г.
- Theoria предлагает проверку ответов ИИ через отслеживание изменений в рассуждении2 июля 2026 г.
- Исследователи связали выводы об ИИ-моделях с выбором метрик производительности2 июля 2026 г.
- Исследование предлагает оценивать LLM‑агентов по «предиктивной валидности», а не по суммарным баллам бенчмарков19 июня 2026 г.