aiminute. ← Toute l’actu IA
Nouveaux Modèles AI Minute Newsroom 2026-08-23

Alibaba a entraîné un modèle sur un rack de 100 téléphones réels — il termine désormais 92 tâches sur 100 sur un vrai appareil

Alibaba a entraîné un modèle sur un rack de 100 téléphones réels — il termine désormais 92 tâches sur 100 sur un vrai appareil

L'équipe Tongyi MAI d'Alibaba a publié le 20 août Qwen-UI-Agent, un modèle conçu pour manipuler des écrans plutôt que répondre à des questions : téléphones, ordinateurs, navigateurs et ligne de commande, dans un seul système. Plutôt que de s'entraîner uniquement en simulation, l'équipe a fait tourner un banc réel de plus de 100 smartphones physiques couvrant plus de 150 applications, et a construit MobileWorld-Real, un test de plus de 400 tâches sur appareils réels. Résultats annoncés : 92,2 % sur MobileWorld-Real, 97,5 % sur AndroidDaily, 79,5 % sur OSWorld-Verified et 73,6 % sur WebArena, devant Claude Opus 4.8 et GPT-5.6 sur le mobile et le navigateur — même si Opus garde l'avantage sur le plus dur OSWorld-v2, 54,8 contre 40. Les modèles MAI-UI plus petits, en 2B et 8B, sont sur Hugging Face sous licence Apache 2.0.

Pourquoi c'est importantCe qui sépare un agent de démonstration d'un agent utile a toujours été l'écart entre simulation et réalité : celui qui clique juste dans un simulateur se perd sur un vrai téléphone devant une vraie fenêtre surgissante. S'entraîner contre un rack de vrais mobiles est une manière coûteuse et sans éclat de combler cet écart, et les chiffres obtenus sur appareils réels sont ceux qu'il faut regarder. Que les petites versions soient ouvertes signifie que la méthode ne restera pas chez Alibaba.
#Code#Agents IA

✓ Vérifié · 3 sources

WhatsApp X Telegram
Lire dans l'app — gratuit, en 9 langues

Actus liées

Un modèle de 27 milliards de paramètres a battu Opus 4.8 et GPT-5.5 pour reproduire des articles publiés
2026-08-23
Un modèle de huit milliards de paramètres qui lit les images et les dessine en 4K, sous licence Apache — la communauté le faisait tourner en deux jours
2026-08-22
OpenAI a donné le moteur qui tourne sous Codex, et ses propres chiffres disent que le moteur vaut plus que le modèle
2026-08-22
Donnez à un modèle la bibliographie d'un article non publié et demandez-lui ce que dit l'article. Les meilleurs trouvent 15 pour cent du temps.
2026-08-22
Les modèles ouverts de Google ont été téléchargés un milliard de fois, et l'extérieur en a fabriqué 100 000 versions
2026-08-22