AWS открыла research preview бенчмарка aws-bench для оценки ИИ-агентов
AWS представила research preview проекта aws-bench, open-source бенчмарка для проверки того, насколько точно и эффективно ИИ-агенты справляются с задачами в инфраструктуре AWS. Набор тестов рассчитан на разработчиков моделей и исследователей, которые создают агентов для работы с облачными сервисами.
Как сообщает Hacker News, aws-bench включает публичный набор сценариев, основанных на анализе реального использования AWS. В него вошли задачи по расследованию инцидентов, troubleshooting и созданию инфраструктуры. Каждый тест связывает запрос на естественном языке с определённым состоянием облачных ресурсов и эталонным ответом. Это позволяет сравнивать результаты разных моделей по единым критериям.
В релиз также вошёл CLI-инструмент для развёртывания тестовых окружений, запуска и оценки прогонов, а также сброса состояния ресурсов. По заявлению AWS, aws-bench можно использовать для улучшения foundation models под задачи AWS, доработки agent harnesses и отслеживания прогресса моделей со временем. Проект уже доступен на GitHub.
Ключевые факты
aws-bench опубликован как open-source проект и доступен на GitHub
Бенчмарк включает сценарии расследования инцидентов, troubleshooting и создания инфраструктуры AWS
Каждый тест содержит запрос на естественном языке, состояние облачных ресурсов и эталонный ответ
В состав релиза входит CLI-инструмент для запуска тестов, оценки прогонов и сброса состояния ресурсов