Nouveaux Modèles
AI Minute Newsroom
2026-08-27
Le modèle anonyme que les développeurs sondaient depuis des semaines est désormais téléchargeable sous licence MIT — et Z.ai affirme que toute la préversion a tourné sur des puces chinoises
Z.ai a publié GLM-5.3-Flash le 26 août en confirmant qu'il s'agit du modèle qui circulait anonymement sous le nom d'Ox Alpha. C'est un modèle à mélange d'experts de 320 milliards de paramètres au total, dont 18 milliards actifs par jeton, doté d'une fenêtre de contexte d'un million de jetons, avec des poids publiés sur Hugging Face sous licence MIT et — une première dans la lignée GLM-5 — une multimodalité native : l'image et la vidéo sont traitées par le modèle de base et non par une couche greffée. L'architecture associe une attention linéaire pour les dépendances locales à une attention parcimonieuse pour le contexte lointain ; à pleine longueur, un composant nommé IndexPool comprime les vecteurs clés de l'indexeur pour éviter que latence et mémoire n'explosent. Z.ai indique un entraînement sur un corpus multimodal d'environ 30 000 milliards de jetons. Selon ses propres chiffres, le modèle obtient 63,4 sur DeepSWE v1.1 contre 46,2 pour GLM-5.2, 48,8 sur AutomationBench contre 26,2, et 84,3 sur Terminal-Bench 2.1 face aux 85,0 de Claude Opus 4.8. Le tarif est de 0,15 dollar par million de jetons en entrée, 0,03 en cache et 0,50 en sortie, soit environ un dixième de GLM-5.2, avec une promotion de 50 % jusqu'au 9 septembre. L'affirmation qui fera le plus débat : Z.ai déclare que l'ensemble de la préversion Ox Alpha a été servie sur des accélérateurs chinois de production nationale, via son propre moteur d'inférence, avec un gain de bout en bout d'environ trois fois sur des dizaines de milliers d'unités. Tous les chiffres de référence sont déclarés par l'entreprise et n'ont pas été reproduits de façon indépendante.
Pourquoi c'est importantDeux choses distinctes se sont produites ici, et il vaut mieux les séparer. La première est un événement de prix : un modèle de 320 milliards de paramètres qui répond aux tests de code et d'agents à un ou deux points d'un modèle frontière fermé, publié sous MIT — la licence la plus permissive qui existe, c'est-à-dire intégrable dans un produit commercial sans demander l'autorisation de qui que ce soit — et à environ un dixième du coût de son prédécesseur. Cela efface l'écart entre ce que l'on loue et ce que l'on peut faire tourner soi-même, et précisément dans les catégories pour lesquelles les entreprises paient. La seconde est l'affirmation matérielle, et elle mérite plus de scepticisme que les résultats. Les contrôles à l'exportation reposent sur l'idée que le calcul avancé est le goulot d'étranglement. Si un laboratoire peut servir un modèle proche de la frontière à un public mondial de testeurs entièrement sur du silicium national, cette prémisse se rétrécit — mais uniquement du côté de l'inférence. Celle-ci est bien moins exigeante que l'entraînement, on ignore quelles puces et avec quelle efficacité, et la seule source est l'entreprise qui tire profit du récit. À noter, pas à parier.
✓ Vérifié · 5 sources
Lire dans l'app — gratuit, en 9 langues
Actus liées
Microsoft a sorti une cage que les agents d'IA ne peuvent pas ouvrir.
2026-10-11La grille tarifaire d'OpenAI affiche un modèle jamais annoncé.
2026-10-11Odyssey ouvre un modèle de monde pilotable depuis le navigateur.
2026-10-11Claude peut désormais répartir une tâche entre mille agents.
2026-10-11Des agents qui recodaient un vieux jeu ont voulu changer leur test.
2026-10-11