Как сообщает Amazon Science, SOP-Bench опубликован в открытом доступе. Это первый бенчмарк такого рода, в котором объединены реальные корпоративные процедуры, работающие инструменты и эталонные ответы. Результат агента оценивается по фактическому выполнению процедуры, а не по тому, насколько его текст соответствует ожиданиям автоматического оценщика.
В основе бенчмарка лежат SOP, составленные отраслевыми экспертами. В таких инструкциях встречаются неявные требования, они могут предполагать наличие профессиональных знаний или требовать выбора между похожими инструментами. Кроме того, агент должен помнить результаты предыдущих действий, координировать несколько инструментов и восстанавливать процесс, если тот отклонился от ожидаемого сценария.
Существующие тесты часто проверяют эти навыки по отдельности: выбор API, соблюдение ограничений или планирование последовательности действий. SOP-Bench позволяет оценивать их вместе, используя процедуры из разных отраслей и сохраняя присущую им неоднозначность. Бенчмарк и экспериментальные результаты представили на конференции KDD 2026.
Ключевые факты
SOP-Bench находится в открытом доступе.
Процедуры для бенчмарка составлены отраслевыми экспертами.
Оценка опирается на работающие инструменты и эталонные ответы.
Бенчмарк и экспериментальные результаты представлены на конференции KDD 2026.
Вопросы и ответы
- Можно ли уже использовать SOP-Bench для оценки своих агентов?
Да, бенчмарк находится в открытом доступе. Его экспериментальные результаты представлены на конференции KDD 2026.
- Чем SOP-Bench отличается от существующих тестов агентов?
Он совместно проверяет выбор инструментов, соблюдение ограничений и планирование действий, тогда как существующие тесты часто оценивают эти способности изолированно. Результат определяется фактическим выполнением процедуры с работающими инструментами, а не совпадением текста с ожиданиями автоматического оценщика.
- Какие сбои и сложности можно проверить перед внедрением агента?
Процедуры, составленные отраслевыми экспертами, проверяют работу с неявными требованиями, выбором между похожими инструментами и профессиональным контекстом. Агент также должен помнить результаты предыдущих действий, координировать несколько инструментов и восстанавливаться после отклонения от сценария.