Агента пора оценивать не по тому, насколько убедительно он рассуждает, а по тому, доставил ли он пригодный результат. Запущенный Baidu бенчмарк DuMateBench двигает рынок именно туда, но пока выглядит скорее как основа для корпоративной приёмки, чем как готовый пропуск в прод.
Что запустила Baidu
Как пишет TechNode, DuMateBench включает больше 200 офисных задач в шести категориях и проверяет работу агентов в сложных операционных средах. Оценка охватывает понимание задачи, использование инструментов, непрерывное выполнение и доставку финального результата.
Это существенная смена единицы измерения. Ответ модели можно оценить в одном сообщении. Агенту нужно понять поручение, выбрать инструменты, выполнить последовательность действий и не развалиться до финиша. Красивый план без готового файла, отчёта или другого требуемого результата здесь должен считаться не частичным успехом, а недоставленной работой.
Baidu использует общий фреймворк оценки и открытые интерфейсы, чтобы разные модели и агенты можно было проверять по одинаковым критериям. Для forward-deployed инженера это, возможно, важнее самой таблицы лидеров: появляется шанс сравнивать не только модели, но и харнессы, настройки и уровни автономности, сохраняя единый контур испытаний.
Лидерборд не равен приёмке
Направление у DuMateBench правильное, но опубликованного TechNode описания недостаточно, чтобы превратить результат бенчмарка в решение о допуске агента к корпоративному процессу. Число задач и перечень измеряемых способностей ещё не отвечают на ключевой практический вопрос: можно ли воспроизвести прогон и получить сопоставимый результат после замены одного компонента.
Корпоративный тест должен позволять зафиксировать среду, инструменты и условия выполнения, затем отдельно менять модель, харнесс или степень автономности. Иначе команда сравнивает сразу несколько переменных, а победителя выбирает по числу, происхождение которого трудно объяснить. Получается привычный рыночный ритуал: десятые доли балла обсуждают дольше, чем реальные причины сбоев.
DuMateBench появляется не в вакууме. В июле MarkTechPost разбирал EdgeBench как практический бенчмарк с разными категориями задач, средами выполнения и бюджетами времени взаимодействия. В августе на arXiv вышел DSAgentBench для сквозных data science-процессов в реальных компьютерных средах, включая работу с ноутбуками, IDE, терминалами, браузерами и базами данных. HealthAgentBench, опубликованный на arXiv в июле, собрал 54 задачи в семи категориях для реалистичных агентных сред в здравоохранении.
Общий вектор ясен: оценка агентов уходит от изолированной способности «дать хороший ответ» к длинной работе внутри среды. DuMateBench полезен тем, что переносит эту логику на широкий набор офисных задач и прямо ставит доставку результата в центр оценки.
Как использовать его уже сейчас
Не стоит ждать, пока лидерборд превратится в слайд поставщика с выделенной жирным первой строкой. Командам полезнее взять структуру DuMateBench как шаблон собственного приёмочного контура.
Для каждой рабочей задачи стоит определить наблюдаемый финал: что именно агент обязан доставить. Затем отдельно проверять понимание поручения, работу с инструментами, способность продолжать выполнение после промежуточных шагов и качество конечного результата. Именно эти четыре слоя перечисляет DuMateBench, и они позволяют увидеть, где сломалась доставка, вместо бинарного «агент умный или не очень».
Такой контур меняет и закупку. Сравнивать нужно не абстрактные модели, а связки из модели, харнесса, инструментов и выбранной автономности. Более сильная модель может проиграть в конкретном процессе, если весь агентный контур хуже доводит задачу до конца. И наоборот, улучшение оркестрации может оказаться полезнее очередной замены модели.
Главный маркер зрелости DuMateBench теперь конкретен: смогут ли независимые команды повторять одинаковые задания в сопоставимых условиях, менять по одному компоненту и получать устойчивую картину результатов. Если да, бенчмарк можно будет адаптировать в приёмочный тест. Если нет, он останется полезной формулировкой проблемы и ещё одной таблицей, которую маркетинг прочитает быстрее инженеров.