Alibaba представила Qwen-UI-Agent как модель, которая работает не с отдельным API сервиса, а с его интерфейсом. По опубликованным оценкам это серьёзный кандидат на роль универсального исполнителя поверх экранов, однако для бизнеса релиз пока остаётся обещанием продукта, а не продуктом: непонятно, где модель вызвать, сколько стоит действие и как быстро оно выполняется.
Один агент на телефон, компьютер и браузер
Как пишет IT Home со ссылкой на официальный аккаунт Qwen, модель охватывает мобильные устройства, компьютеры, веб и DeepSearch. На MobileWorld она набрала 82,1%, опередив GPT-5.6 Sol, Claude Opus 4.8 и Seed 2.1 Pro на 12,0, 14,6 и 8,9 процентного пункта соответственно. На тесте с реальными устройствами MobileWorld-Real результат составил 92,2%, на AndroidDaily 97,5%.
Для desktop заявлены 79,5% на OSWorld-Verified и 40% на OSWorld-v2 Partial. Во втором тесте модель потратила на 58% меньше шагов относительно базового решения. На WebArena результат составил 73,6%, на BrowseComp-ZH 75%, а на ScreenSpot-Pro, где проверяется способность находить нужные элементы интерфейса, 81,5%.
Здесь важен не отдельный процент, а ширина контура. Alibaba показывает одну основу для Android-приложений, браузера, desktop-программ и поиска. Для билдера это потенциально означает меньше отдельных автоматизаций под каждый интерфейс. Сегодня кнопка живёт в одном месте, завтра дизайнер передвинул её на десять пикселей, и традиционный скрипт отправился знакомиться с техдолгом. GUI-агент должен ориентироваться по экрану и цели, а не по заранее прописанному селектору.
Компания подкрепляет заявку инфраструктурой: для обучения и оценки использовалась среда со 100 с лишним реальными телефонами и более чем 150 приложениями. Собственный MobileWorld-Real включает свыше 400 задач в более чем 100 приложениях. Модель обучали на траекториях длиннее 100 шагов примерно в 10 тысячах параллельных сред.
Qwen-UI-Agent также умеет переходить от кликов к командной строке. В компьютерных задачах почти половина действий приходится на CLI, а около 40% выдаются пакетами. Это разумная архитектура: агенту незачем изображать очень терпеливого стажёра и прокликивать интерфейс, если ту же операцию можно выполнить командой.
Benchmark уже есть, экономики пока нет
Главный пробел релиза находится не в таблице результатов. IT Home приводит ссылки на технический отчёт, страницу проекта и GitHub, но в публикации нет условий доступа к самой модели, поддерживаемых способов развёртывания, цены, latency или требований к инфраструктуре. Неясно и то, можно ли уже получить воспроизводимый результат на собственных приложениях, а не только посмотреть официальные оценки.
Поэтому объявлять Qwen-UI-Agent заменой browser automation и RPA рано. Для такой замены недостаточно хорошо пройти WebArena или OSWorld. Рабочий сценарий должен стабильно переживать авторизацию, всплывающие окна, медленную загрузку и изменение интерфейса, а затем укладываться в приемлемую стоимость и время. В источнике нет данных, по которым это можно проверить.
Есть и ещё одна граница. Примеры Alibaba выглядят как настоящая офисная рутина: найти кафе через несколько приложений и суммировать отзывы, подобрать поезд и создать встречу в DingTalk, перенести чеки с телефона на удалённый компьютер и собрать Excel. Но это описания заданий, а не опубликованные разборы прохождения с частотой успеха, временем и числом вмешательств человека.
При этом списывать релиз как демонстрацию тоже было бы ошибкой. В июле и августе Alibaba последовательно продвигала Qwen3.8 именно в сторону длинных агентных задач, офисной работы и управления инструментами. Компания открыла веса Qwen3.8-2.4T-A95B и Qwen3.8-27B, а теперь вынесла работу с GUI в отдельную модель. Qwen-UI-Agent выглядит не случайным экспериментом, а следующим слоем этой стратегии: сначала модель рассуждает и пишет код, затем получает руки для существующих программ.
Для российского билдера практический вывод простой. Qwen-UI-Agent нужно немедленно поставить в shortlist рядом с компьютерными агентами OpenAI и Anthropic, но пока не в production. Тестировать его имеет смысл прежде всего там, где API нет, интеграция слишком дорога или интерфейс меняется достаточно часто, чтобы поддержка скриптов съедала выгоду от автоматизации. Платежи, удаление данных и выдачу доступов сама Alibaba относит к чувствительным операциям: в таких точках агент должен остановиться и запросить подтверждение.
Следующий маркер будет вполне измеримым: появятся публичный способ запуска модели, цена и данные о задержке. После этого нужен не ещё один общий benchmark, а прогон на собственных 20–30 сценариях с четырьмя числами: доля завершённых задач, число вмешательств человека, время и стоимость выполнения. Если Qwen-UI-Agent выиграет у текущих скриптов хотя бы по надёжности и цене поддержки, экран действительно станет новым API. Пока Alibaba показала, что агент видит этот API, но ещё не дала бизнесу к нему ключ.