Simular заявила, что её компьютерный агент Sai выполнил 73% заданий в обновлённом тесте OSWorld 2.0. Как сообщает The New Stack со ссылкой на компанию, проверка включала 108 задач, имитирующих длительную повседневную профессиональную работу. У квалифицированного человека такая работа обычно занимает более 1 часа.
По данным Simular, Sai опередил GPT-5.6 Sol, для которого OpenAI указала результат 62,57%, а также Opus 5 от Anthropic с показателем 70,57%. При этом, как утверждает компания, работа Sai обошлась примерно в две трети стоимости каждого из этих решений.
Sai может работать с полноценными настольными приложениями и веб-страницами, вызывать API и писать код. Агент использует нейросимволический метод: выполненные задачи преобразуются в переиспользуемый код, который можно применять при следующих запусках.
На официальном сайте OSWorld 2.0 результат Sai пока не опубликован. Simular сообщила, что отправляет его в рейтинг и загружает траектории агента на Hugging Face.
Ключевые факты
OSWorld 2.0 включает 108 задач, на выполнение которых квалифицированному человеку обычно требуется более 1 часа.
По данным OpenAI, GPT-5.6 Sol набрал 62,57%, а по данным Anthropic, результат Opus 5 составил 70,57%.
Simular оценила стоимость работы Sai примерно в две трети стоимости каждого из двух сравниваемых решений.
Simular сообщила, что отправляет результат в рейтинг OSWorld 2.0 и загружает траектории агента на Hugging Face.
Вопросы и ответы
- Насколько Sai дешевле сравниваемых решений?
По оценке Simular, работа Sai стоит примерно две трети от стоимости GPT-5.6 Sol и Opus 5.
- Что Sai умеет делать в реальных рабочих сценариях?
Агент работает с настольными приложениями и веб-страницами, вызывает API и пишет код. Выполненные задачи можно преобразовывать в переиспользуемый код для последующих запусков.
- Можно ли уже проверить результат в официальном рейтинге?
Пока нет: 73% ещё не отображаются на сайте OSWorld 2.0. Simular отправляет результат в рейтинг и загружает траектории агента на Hugging Face.
Контекст по теме
- SWE-Bench ProMax проверяет ИИ-агентов на масштабном рефакторинге кода21 августа 2026 г.
- OpenAI расширяет Codex и ускоряет агентные рабочие процессы, а экосистема инструментов добавляет новые возможности9 июня 2026 г.
- GLM-5.1 поднялась на третье место в Code Arena, а агентные фреймворки и маршрутизация моделей набирают популярность9 июня 2026 г.
- Anthropic представила модель Claude Opus 4.7 с улучшениями для кодирования и агентных задач9 июня 2026 г.