К содержанию
Выпуск №80 · 27 августа 2026 / Новости

Simular заявила о результате Sai в 73% на OSWorld 2.0

Как сообщает The New Stack со ссылкой на компанию, проверка включала 108 задач, имитирующих длительную повседневную профессиональную работу.

Редакция 27 августа 2026 г., 23:35 MSK

В Telegram

Simular заявила, что её компьютерный агент Sai выполнил 73% заданий в обновлённом тесте OSWorld 2.0. Как сообщает The New Stack со ссылкой на компанию, проверка включала 108 задач, имитирующих длительную повседневную профессиональную работу. У квалифицированного человека такая работа обычно занимает более 1 часа.

По данным Simular, Sai опередил GPT-5.6 Sol, для которого OpenAI указала результат 62,57%, а также Opus 5 от Anthropic с показателем 70,57%. При этом, как утверждает компания, работа Sai обошлась примерно в две трети стоимости каждого из этих решений.

Sai может работать с полноценными настольными приложениями и веб-страницами, вызывать API и писать код. Агент использует нейросимволический метод: выполненные задачи преобразуются в переиспользуемый код, который можно применять при следующих запусках.

На официальном сайте OSWorld 2.0 результат Sai пока не опубликован. Simular сообщила, что отправляет его в рейтинг и загружает траектории агента на Hugging Face.

Ключевые факты

  • OSWorld 2.0 включает 108 задач, на выполнение которых квалифицированному человеку обычно требуется более 1 часа.

  • По данным OpenAI, GPT-5.6 Sol набрал 62,57%, а по данным Anthropic, результат Opus 5 составил 70,57%.

  • Simular оценила стоимость работы Sai примерно в две трети стоимости каждого из двух сравниваемых решений.

  • Simular сообщила, что отправляет результат в рейтинг OSWorld 2.0 и загружает траектории агента на Hugging Face.

Вопросы и ответы

Насколько Sai дешевле сравниваемых решений?

По оценке Simular, работа Sai стоит примерно две трети от стоимости GPT-5.6 Sol и Opus 5.

Что Sai умеет делать в реальных рабочих сценариях?

Агент работает с настольными приложениями и веб-страницами, вызывает API и пишет код. Выполненные задачи можно преобразовывать в переиспользуемый код для последующих запусков.

Можно ли уже проверить результат в официальном рейтинге?

Пока нет: 73% ещё не отображаются на сайте OSWorld 2.0. Simular отправляет результат в рейтинг и загружает траектории агента на Hugging Face.

Контекст по теме

Как процитировать

«Simular заявила о результате Sai в 73% на OSWorld 2.0». hegai.media, 27 августа 2026 г.. https://hegai.media/novosti/simular-zayavila-o-rezultate-sai-v-73-na-osworld-2-0--5920547b-04f6-4d74-bd1a-511d2191f673

так материал выглядит в мессенджере