Как сообщает TechNode, Baidu запустила DuMateBench, рейтинг для оценки возможностей ИИ-агентов. Он проверяет, умеют ли они справляться с реальными задачами и выдавать готовые к использованию результаты, а не просто формировать ответы. В рейтинг вошли более 200 офисных задач в шести категориях, которые тестируют работу агентов в сложных операционных средах.
DuMateBench оценивает понимание задачи, использование инструментов, непрерывность выполнения и передачу итогового результата. Единая система оценки и открытые интерфейсы позволяют проверять разные модели и агенты по общим критериям. В центре внимания не то, на какие вопросы способна ответить модель, а то, что она может выполнить и предоставить.
Ключевые факты
В DuMateBench вошли более 200 офисных задач в шести категориях.
Оценка охватывает понимание задачи, использование инструментов, непрерывное выполнение и передачу итогового результата.
Общая система оценки и открытые интерфейсы позволяют тестировать разные модели и агенты по единым критериям.
Вопросы и ответы
- Какие рабочие сценарии проверяет DuMateBench?
Бенчмарк включает более 200 офисных задач в шести категориях и тестирует агентов в сложных операционных средах.
- Что именно оценивается помимо качества ответа модели?
DuMateBench проверяет четыре аспекта: понимание задачи, использование инструментов, непрерывное выполнение и передачу готового результата.
- Можно ли сравнивать разные модели и агенты между собой?
Да. Общая система оценки и открытые интерфейсы позволяют тестировать разные модели и агенты по единым критериям.
Контекст по теме
- Почему для AI‑агентов нужны новые системы бенчмаркинга29 июня 2026 г.
- OpenAI представила LifeSciBench, бенчмарк из 750 задач для оценки ИИ в реальных исследованиях в биологии19 июня 2026 г.
- LifeSciBench, бенчмарк для оценки ИИ в задачах исследований в области life science17 июня 2026 г.
- Платформа NVIDIA Blackwell возглавила первый бенчмарк инфраструктуры для agentic AI12 июня 2026 г.