К содержанию
Новости

AWS открыла research preview бенчмарка aws-bench для оценки ИИ-агентов

AWS открыла research preview бенчмарка aws-bench для оценки ИИ-агентов

AWS представила research preview проекта aws-bench, open-source бенчмарка для проверки того, насколько точно и эффективно ИИ-агенты справляются с задачами в инфраструктуре AWS. Набор тестов рассчитан на разработчиков моделей и исследователей, которые создают агентов для работы с облачными сервисами.

Как сообщает Hacker News, aws-bench включает публичный набор сценариев, основанных на анализе реального использования AWS. В него вошли задачи по расследованию инцидентов, troubleshooting и созданию инфраструктуры. Каждый тест связывает запрос на естественном языке с определённым состоянием облачных ресурсов и эталонным ответом. Это позволяет сравнивать результаты разных моделей по единым критериям.

В релиз также вошёл CLI-инструмент для развёртывания тестовых окружений, запуска и оценки прогонов, а также сброса состояния ресурсов. По заявлению AWS, aws-bench можно использовать для улучшения foundation models под задачи AWS, доработки agent harnesses и отслеживания прогресса моделей со временем. Проект уже доступен на GitHub.

Ключевые факты

  • aws-bench опубликован как open-source проект и доступен на GitHub

  • Бенчмарк включает сценарии расследования инцидентов, troubleshooting и создания инфраструктуры AWS

  • Каждый тест содержит запрос на естественном языке, состояние облачных ресурсов и эталонный ответ

  • В состав релиза входит CLI-инструмент для запуска тестов, оценки прогонов и сброса состояния ресурсов