Amazon Science опубликовала SOP-Bench, бенчмарк для проверки агентов на реальных стандартных операционных процедурах. Его ценность не в еще одной таблице моделей, а в смене самого вопроса: не «насколько умно агент рассуждает», а «можно ли доверить ему конкретную работу компании и получить проверяемый результат».
Для бизнеса это более полезная граница между демо и внедрением. Агент может убедительно нажимать кнопки в браузере и правильно выбирать API в стерильном тесте, но провалиться там, где нужно помнить предыдущие действия, соблюдать внутренние правила и разбираться в инструкции, написанной людьми для людей.
Что именно проверяет SOP-Bench
SOP, как объясняет Amazon Science, фиксирует последовательность действий, по которой организация выполняет регулярную важную работу. Больница использует такую процедуру при регистрации пациента, логистическая команда при классификации опасного груза, банк при проверке нового корпоративного клиента, служба доверия и безопасности при решении об удалении контента.
В SOP-Bench вошло более 2 000 задач из 12 бизнес-областей, включая прием пациентов, классификацию опасных грузов, клиентский сервис, модерацию контента, финансовый комплаенс и складские проверки. Для каждой задачи есть текст процедуры, доступные агенту инструменты, спецификации этих инструментов и тестовые случаи с известными правильными ответами.
Агент должен не написать правдоподобный ответ, а выполнить процедуру через вызовы инструментов. Фреймворк сохраняет историю этих вызовов и решений, сверяет итог с эталоном и позволяет найти шаг, на котором возникла ошибка. В комплекте есть два базовых агента, но команда может подключить собственный и добавить свои процедуры.
Это принципиальное отличие от оценки «модель ответила примерно разумно». Здесь результат либо совпал с известным правильным исходом, либо нет, а красивый текст не компенсирует неправильно выполненную операцию.
Почему обычных агентских тестов уже недостаточно
По версии Amazon Science, существующие бенчмарки часто изолируют одну способность: выбор подходящего API, соблюдение набора ограничений или построение плана. Обычно они используют чистые, машинно подготовленные задания. Реальные процедуры устроены хуже, зато честнее: часть контекста не записана, некоторые формулировки допускают толкование, а следующие действия зависят от предыдущих.
В источнике приведен пример с проверкой страховки пациента. Процедура требует сделать это на четвертом и шестом шагах, но не объясняет, почему проверка повторяется. Сотрудник понимает, что сначала нужно подтвердить покрытие у страховщика, а затем проверить корректность данных в системе медицинской организации. Агенту приходится угадывать смысл, помнить уже выполненные действия и выбирать между похожими инструментами.
Именно здесь корпоративный агент перестает быть чат-ботом с доступом к кнопкам. От него требуется не абстрактная сообразительность, а способность исполнять накопленную операционную логику компании. Amazon Science пишет, что эксперименты с SOP-Bench выявили ограничения даже у сильных фундаментальных моделей. Значит, выбирать систему только по общему лидерборду или эффектному пилоту рискованно: эти испытания могут просто не содержать тот тип сложности, на котором держится ваш процесс.
SOP можно превратить в приемочный тест
Практический ход для команды внедрения прост. Взять несколько процедур, где цена ошибки понятна, описать доступные агенту инструменты и подготовить набор случаев с заранее известными исходами. Затем прогнать через них кандидатов на роль модели и харнесса.
Смотреть стоит как минимум на завершение процедуры и места, где агент отклоняется от ожидаемого хода. По журналам вызовов инструментов можно отдельно проверять соблюдение ограничений, повторные попытки и запрещенные действия. Число вмешательств человека тоже имеет смысл добавить в собственную приемочную матрицу: агент, который получает правильный итог только после постоянных подсказок, автоматизирует презентацию, а не процесс.
Выигрывают здесь команды, у которых SOP уже существуют и отражают реальную работу. Их документация становится не только инструкцией для сотрудников, но и исполняемым контрактом для агента. Тем, у кого процедуры живут в головах нескольких опытных операторов, сначала придется извлечь эту логику наружу. Это полезная, хотя и не самая приятная диагностика: возможно, компания пока не готова автоматизировать процесс, потому что сама не умеет однозначно объяснить, как он работает.
Смотреть дальше нужно не на место SOP-Bench в академических рейтингах, а на собственный контур закупки. Если к следующему выбору модели или харнесса команда сможет показать долю ключевых SOP, превращенных в запускаемые тесты, процент корректно завершенных случаев, повторяющиеся точки отказа и число вмешательств человека, подход прижился. Если решение снова примут по общим бенчмаркам и часовому демо, корпоративный агент останется убедительным ровно до первой неоднозначной инструкции.