aiminute. ← 全部AI新闻
新模型 AI Minute Newsroom 2026-08-23

阿里巴巴用一整架100部真实手机训练模型——如今在真机上100个任务能完成92个

阿里巴巴用一整架100部真实手机训练模型——如今在真机上100个任务能完成92个

阿里巴巴通义MAI团队于8月20日发布Qwen-UI-Agent,这是一个为操作屏幕而非回答问题而生的模型,涵盖手机、桌面、浏览器和命令行,统一在一套系统中。团队没有只在模拟环境中训练,而是搭建了一个由100多部真实手机、覆盖150多个应用的在线实机集群,并构建了MobileWorld-Real——一个在真机上包含400多项任务的基准。公布的结果为:MobileWorld-Real 92.2%、AndroidDaily 97.5%、OSWorld-Verified 79.5%、WebArena 73.6%,在移动端和浏览器任务上领先Claude Opus 4.8与GPT-5.6;但在更难的OSWorld-v2上,Opus仍以54.8比40领先。规模较小的MAI-UI 2B和8B模型已在Hugging Face上以Apache 2.0协议开放。

为什么重要?演示级智能体和好用的智能体之间的差距,一直是模拟到现实的鸿沟:在模拟器里点得准的智能体,一到真手机、一遇真弹窗就迷路。用一整架真机来训练,是一条昂贵又不炫目的弥合路径,而真机上的数字才是值得盯的数字。小版本开源,意味着这套方法不会只留在阿里巴巴内部。
#编程#AI智能体

✓ 已核实 · 3个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

一个270亿参数的模型在复现已发表论文上胜过了Opus 4.8和GPT-5.5
2026-08-23
一个 80 亿参数的模型,既能看图又能画图,还支持原生 4K,采用 Apache 许可——社区两天就跑起来了
2026-08-22
OpenAI 把 Codex 底下的引擎白送了出去——而它自己的数据说,引擎比模型更值钱
2026-08-22
给模型一篇未发表论文的参考文献列表,问这篇论文讲了什么。最好的模型也只有15%答对。
2026-08-22
谷歌的开放模型已被下载十亿次,外部开发者做出了10万个版本
2026-08-22