К содержанию
Новости

AgentSLABench предложил оценивать ИИ-агентов с учётом затрат ресурсов

Инфографика: 16 тестовых сред
Графика: hegai.media

Исследователи представили AgentSLABench, фреймворк для оценки автономных ИИ-агентов. Он измеряет не только корректность выполнения задач, но и задержку, стоимость, вычислительные затраты, использование памяти и сети в рамках заданных ограничений ресурсов. Для каждого агента и задачи система формирует многомерный профиль, по аналогии с профайлерами perf, pprof и cProfile, при этом качество выполнения оценивается отдельно.

Как сообщает arXiv cs.AI (Artificial Intelligence), AgentSLABench включает 16 сред для тестирования в шести категориях. Среди пяти основных направлений указаны multi-hop QA, retail substitution, code generation, web shopping и travel planning. Тесты запускаются в изолированных Docker-контейнерах с заранее заданными лимитами CPU, памяти, времени и сетевого трафика. Также используются закрытые тестовые наборы с SHA256-хешами.

Авторы протестировали пять универсальных базовых агентов: ReAct, PlanAndSolve, Reflexion, CoT и Random, а также четыре специализированных агента. По данным исследования, специализированные системы показали 100% успешности в fact_qa, web_shopping и travel_planning. В задачах retail и code_gen результаты находились в диапазоне 66,7–83,3%. Универсальные базовые агенты, как отмечают авторы, полностью провалили 4 из 5 доменных задач.

Ключевые факты

  • AgentSLABench включает 16 тестовых сред в шести категориях задач

  • Фреймворк использует изолированные Docker-контейнеры и фиксированные лимиты CPU, памяти, времени и сетевого трафика

  • Проверялись пять базовых агентов: ReAct, PlanAndSolve, Reflexion, CoT и Random

  • Специализированные агенты показали 66,7–83,3% успешности в retail и code_gen

Вопросы и ответы

Чем AgentSLABench отличается от обычных бенчмарков ИИ-агентов?

Фреймворк оценивает не только успешность выполнения задачи, но и задержку, стоимость, потребление CPU, памяти и сетевого трафика. Тесты запускаются в изолированных Docker-контейнерах с фиксированными лимитами ресурсов, что позволяет сравнивать агентов в одинаковых условиях.

Насколько универсальные агенты проигрывают специализированным на прикладных задачах?

В исследовании специализированные агенты показали 100% успешности в fact_qa, web_shopping и travel_planning, а в retail и code_gen набрали 66,7–83,3%. При этом универсальные базовые агенты ReAct, PlanAndSolve, Reflexion, CoT и Random полностью провалили 4 из 5 доменных задач.

Какие сценарии и среды уже покрывает AgentSLABench?

В бенчмарке 16 тестовых сред в шести категориях задач, включая multi-hop QA, retail substitution, code generation, web shopping и travel planning. Для проверки используются закрытые тестовые наборы с SHA256-хешами.

Контекст по теме