AgentSLABench предложил оценивать ИИ-агентов с учётом затрат ресурсов

Исследователи представили AgentSLABench, фреймворк для оценки автономных ИИ-агентов. Он измеряет не только корректность выполнения задач, но и задержку, стоимость, вычислительные затраты, использование памяти и сети в рамках заданных ограничений ресурсов. Для каждого агента и задачи система формирует многомерный профиль, по аналогии с профайлерами perf, pprof и cProfile, при этом качество выполнения оценивается отдельно.
Как сообщает arXiv cs.AI (Artificial Intelligence), AgentSLABench включает 16 сред для тестирования в шести категориях. Среди пяти основных направлений указаны multi-hop QA, retail substitution, code generation, web shopping и travel planning. Тесты запускаются в изолированных Docker-контейнерах с заранее заданными лимитами CPU, памяти, времени и сетевого трафика. Также используются закрытые тестовые наборы с SHA256-хешами.
Авторы протестировали пять универсальных базовых агентов: ReAct, PlanAndSolve, Reflexion, CoT и Random, а также четыре специализированных агента. По данным исследования, специализированные системы показали 100% успешности в fact_qa, web_shopping и travel_planning. В задачах retail и code_gen результаты находились в диапазоне 66,7–83,3%. Универсальные базовые агенты, как отмечают авторы, полностью провалили 4 из 5 доменных задач.
Ключевые факты
AgentSLABench включает 16 тестовых сред в шести категориях задач
Фреймворк использует изолированные Docker-контейнеры и фиксированные лимиты CPU, памяти, времени и сетевого трафика
Проверялись пять базовых агентов: ReAct, PlanAndSolve, Reflexion, CoT и Random
Специализированные агенты показали 66,7–83,3% успешности в retail и code_gen
Вопросы и ответы
- Чем AgentSLABench отличается от обычных бенчмарков ИИ-агентов?
Фреймворк оценивает не только успешность выполнения задачи, но и задержку, стоимость, потребление CPU, памяти и сетевого трафика. Тесты запускаются в изолированных Docker-контейнерах с фиксированными лимитами ресурсов, что позволяет сравнивать агентов в одинаковых условиях.
- Насколько универсальные агенты проигрывают специализированным на прикладных задачах?
В исследовании специализированные агенты показали 100% успешности в fact_qa, web_shopping и travel_planning, а в retail и code_gen набрали 66,7–83,3%. При этом универсальные базовые агенты ReAct, PlanAndSolve, Reflexion, CoT и Random полностью провалили 4 из 5 доменных задач.
- Какие сценарии и среды уже покрывает AgentSLABench?
В бенчмарке 16 тестовых сред в шести категориях задач, включая multi-hop QA, retail substitution, code generation, web shopping и travel planning. Для проверки используются закрытые тестовые наборы с SHA256-хешами.
Контекст по теме
- Почему для AI‑агентов нужны новые системы бенчмаркинга29 июня 2026 г.
- RIFT-Bench предлагает единый подход к динамическому red-teaming агентных AI‑систем24 июня 2026 г.
- Исследование сравнило эффективность GUI- и CLI‑агентов при выполнении задач на компьютере24 июня 2026 г.
- Исследование предлагает оценивать LLM‑агентов по «предиктивной валидности», а не по суммарным баллам бенчмарков19 июня 2026 г.