Исследователи разработали тест, состоящий из 1490 рабочих задач, предназначенный для оценки возможностей систем искусственного интеллекта. Подход предполагает проверку того, насколько модели справляются с задачами, связанными с повседневной работой.
Результаты показали, что даже ведущие системы отрасли выполняют лишь часть предложенных заданий. По данным исследования, лидеры индустрии смогли справиться только с четвертью задач из набора.
Авторы отмечают, что многие трудности связаны с простыми повседневными действиями, на которых, как показал тест, автоматизация может давать сбои.