阿里巴巴通义MAI团队于8月20日发布Qwen-UI-Agent,这是一个为操作屏幕而非回答问题而生的模型,涵盖手机、桌面、浏览器和命令行,统一在一套系统中。团队没有只在模拟环境中训练,而是搭建了一个由100多部真实手机、覆盖150多个应用的在线实机集群,并构建了MobileWorld-Real——一个在真机上包含400多项任务的基准。公布的结果为:MobileWorld-Real 92.2%、AndroidDaily 97.5%、OSWorld-Verified 79.5%、WebArena 73.6%,在移动端和浏览器任务上领先Claude Opus 4.8与GPT-5.6;但在更难的OSWorld-v2上,Opus仍以54.8比40领先。规模较小的MAI-UI 2B和8B模型已在Hugging Face上以Apache 2.0协议开放。