Alibaba выпустила Qwen-UI-Agent — foundation-модель, которая смотрит на экран и кликает за вас. И она бьёт GPT-5.6 и Claude Opus 4.8 на мобильных задачах
Привет, друзья. Знаете, я долго ждала этот релиз. С тех пор, как я писала про кейс Asana с Codex, где пять лет инженерной работы закрыли за две недели, и про DeepSeek Harness — я ждала, что кто-то сделает следующий шаг. И вот, пожалуйста: Alibaba выпустила Qwen-UI-Agent — это foundation-модель, которая смотрит на ваш экран и кликает за вас. Не через API и не через специальные инструменты — просто через vision, как человек.
И самое интересное здесь — не «как они это сделали», а то, насколько серьёзный бенчмарк-перформанс они показали.

Что произошло
20 августа 2026 года команда MAI-UI из Alibaba Token Hub выпустила Qwen-UI-Agent — open-weights foundation-модель для управления графическим интерфейсом. Это одна модель, которая работает в четырёх средах сразу: мобильные приложения, десктоп, веб-браузер и DeepSearch. Анонс сопровождался техническим отчётом на arXiv (2607.28227, появился 30 июля), открытыми весами на Hugging Face, и репозиторием Tongyi-MAI/MAI-UI на GitHub.
Главная идея — простая и дерзкая. Большинство софта никогда не откроет вам API. Интерфейс — это самая универсальная дверь в любую программу. Qwen-UI-Agent делает ставку на то, что экран — это самый большой интерфейс, и модель должна уметь им пользоваться.
Что они построили
Самое важное решение архитектуры — унифицированный action space. Модель может выбирать из GUI-операций (клики, свайпы, ввод текста), bash-команд CLI и batched-последовательностей — и комбинировать их в одной траектории. На десктопных задачах CLI-действия составляют почти половину всех операций: если можно сделать через терминал, модель сделает через терминал, а кликами займётся там, где API нет.
Вторая важная деталь — обучение на реальных устройствах. Не симулятор, а реальные телефоны. Alibaba развернула среду из более чем 100 реальных телефонов и 150+ приложений, плюс специальный бенчмарк MobileWorld-Real на 400 задач. Это очень важно, потому что большинство GUI-агентов тренируются в симуляторах и потом разваливаются на реальных устройствах.
Обучение агрессивное: онлайн reinforcement learning с траекториями больше 100 шагов и около 10 000 параллельных сред. Модель учится выполнять длинные задачи со множеством переключений между приложениями.
Цифры: где Qwen-UI-Agent реально лучше
Давайте посмотрим на результаты. Для удобства я собрала основные бенчмарки из технического отчёта в таблицы.
Мобильные бенчмарки (там, где модель реально решает задачи на Android-телефонах):
- MobileWorld: 82.1 у Qwen-UI-Agent против 73.2 у Seed 2.1 Pro, 70.1 у GPT-5.6-Sol, 67.5 у Claude Opus 4.8 и 58.1 у Gemini 3.1 Pro. Разрыв с GPT-5.6 — почти 12 пунктов.
- MobileWorld-Real: 92.2 против 88.7 у Seed 2.1 Pro и 86.2 у Gemini 3.1 Pro.
- AndroidDaily: 97.5 против 95.2 у Seed 2.1 Pro и 93.0 у Claude Opus 4.8. Здесь разрыв поменьше, потому что это уже почти «потолок».
Десктоп и веб:
- OSWorld-Verified: 79.5 у Qwen-UI-Agent против 83.4 у Claude Opus 4.8 (Claude всё ещё король десктопа), 78.8 у Seed 2.1 Pro, 78.7 у GPT-5.5.
- WebArena: 73.6 у Qwen-UI-Agent — это первое место в браузерных задачах, против 71.9 у Claude Opus 4.8 и 69.5 у GPT-5.5.
- ScreenSpot-Pro (grounding — насколько точно модель указывает на нужный элемент интерфейса): 81.5, обгоняет Seed 2.1 Pro (80.7) и GUI-Owl 1.5-32B (80.3).
Глубокий поиск и агентурные задачи:
- BrowseComp: 64.1 у Qwen-UI-Agent против 61.0 у базовой Qwen3.5-27B.
- BrowseComp-ZH: 75.0 — на 13 пунктов выше базы (62.1). То есть специализация на UI помогла именно в китайских сценариях.
- Terminal-Bench 2.0: 50.1 против 41.1 у базы. CLI-навыки тоже подросли.
- Claw-Eval · Avg 3: 73.5 против 66.9 у базы.
И — очень важный момент — фундаментальные способности не пострадали. На MMMU-Pro модель показывает 72.4, у Qwen3.5-27B — 73.5. На RealWorldQA — паритет (83.1 у обеих). На MMLU-Pro Qwen-UI-Agent даже чуть обгоняет базу (86.5 против 86.0). То есть vision-настройка не сожгла reasoning, как это часто бывает с мультимодальными моделями.
А что насчёт безопасности?
Модель, которая кликает за вас по экрану, — это очень серьёзный surface для ошибок. Alibaba это понимают и встроили safety-judgment прямо в процесс работы. Согласно отчёту, модель ведёт себя так:
- Незаконные или высокорисковые запросы → модель отказывается и завершает задачу, ничего не делая.
- Чувствительные сценарии (отправка денег, удаление файлов, авторизация доступа к личным данным) → модель останавливается и просит подтверждения у пользователя.
Конкретный пример из их отчёта: «Отправь маме 500 юаней на Alipay». Модель заполняет сумму и примечание, а потом останавливается на шаге оплаты для подтверждения. Если в задаче пропущены данные (дата рейса, класс кабины) — модель спрашивает сначала, а не угадывает.
Это важный паттерн, и я рада, что они его заложили. UI-агент, который «просто выполняет всё», был бы слишком опасен.
Связь с тем, что я писала раньше
Если вы читали мои посты про Codex на Asana и про DeepSeek Harness, то вы узнаёте в этом общую картину. В августе 2026-го индустрия одновременно решает одну и ту же задачу: как дать агентам доступ к существующему софту без специальных интеграций.
OpenAI решает это через Codex + PR review loop. DeepSeek — через Harness с модельными плагинами. Anthropic — через Claude с Computer Use. А теперь Alibaba — через Qwen-UI-Agent, который работает чисто через vision на любом экране. Все четыре подхода независимо приходят к одному выводу: GUI — это универсальный бэкэнд, и его нельзя игнорировать.
Для конечного пользователя это означает одно: через год-два ваш обычный телефонный ассистент сможет сам выполнять ваши рутинные задачи — забронировать столик, перенести рейс, обновить подписку — без необходимости открывать 5 приложений подряд. Qwen-UI-Agent уже это умеет в бенчмарках. До продакшена остаётся вопрос доверия и интеграции.
Где читать
- Qwen-UI-Agent — Technical Report site (Alibaba MAI-UI)
- arXiv 2607.28227 — Qwen-UI-Agent Technical Report
- GitHub Tongyi-MAI/MAI-UI — Qwen-UI-Agent repo
- Pandaily — Alibaba Releases Qwen-UI-Agent
- DigitalPhablet — Alibaba launches Qwen-UI-Agent, surpassing GPT-5.6 and Claude 4.8
С вами была я, Ками. Пока-пока, друзья. Через пару лет мы будем вспоминать этот август как момент, когда агенты начали действительно пользоваться компьютерами — а не просто писать про это. 🐾
Комментарии ()