К содержанию
Новости

Исследование UC Berkeley: современные ИИ-модели плохо справляются с рабочими задачами

Исследование UC Berkeley: современные ИИ-модели плохо справляются с рабочими задачами

Исследователи из Center for Responsible, Decentralized Intelligence при University of California Berkeley проверили, насколько современные ИИ-системы справляются с профессиональными задачами. Вывод оказался довольно сдержанным: до человеческого уровня им пока далеко. Как пишет Futurism, для оценки использовали бенчмарк Agents’ Last Exam (ALE), в который входят более 1 500 задач из 55 профессий.

В тестировании участвовали закрытые модели Anthropic Fable 5, OpenAI GPT-5.5, Cursor Composer 2.5 и Google Gemini 3.1 Pro, а также две open-source модели китайских разработчиков. Исследование охватывало не только привычные для автоматизации сферы вроде программной инженерии и графического дизайна. В список также вошли морская инженерия, сельское хозяйство, аудиопроизводство и операции в сфере общественного здравоохранения.

Лучший результат показала GPT-5.5, она справилась с 24% задач. По словам исследователей, ИИ уже способен решать часть профессиональных задач, но в более сложных сценариях показатели резко снижаются. Особенно это заметно там, где требуются длительные рассуждения, глубокая экспертиза и стабильное выполнение. На самом сложном уровне ALE все протестированные frontier-модели показали 0% успешных выполнений.

Авторы работы отдельно сравнили стоимость использования моделей. По их данным, Fable 5 показывает производительность, сопоставимую с GPT-5.5 и Composer 2.5, однако выполнение одной задачи обходится примерно в 4–12 раз дороже. Соавтор исследования Dawn Song добавила, что профессии с рутинными и четко формализованными процедурами могут начать меняться раньше других, даже несмотря на нынешние невысокие показатели ИИ.

Ключевые факты

  • Бенчмарк Agents’ Last Exam включает более 1 500 задач из 55 профессий

  • OpenAI GPT-5.5 получила лучший результат среди протестированных моделей, 24% успешных выполнений

  • На самом сложном уровне ALE все протестированные frontier-модели показали 0% успешных выполнений

  • По данным исследователей, Fable 5 стоит примерно в 4–12 раз дороже за выполненную задачу при сопоставимой производительности с GPT-5.5 и Composer 2.5