Nouveaux Modèles
AI Minute Newsroom
2026-08-27
Le modèle anonyme que les développeurs sondaient depuis des semaines est désormais téléchargeable sous licence MIT — et Z.ai affirme que toute la préversion a tourné sur des puces chinoises
Z.ai a publié GLM-5.3-Flash le 26 août en confirmant qu'il s'agit du modèle qui circulait anonymement sous le nom d'Ox Alpha. C'est un modèle à mélange d'experts de 320 milliards de paramètres au total, dont 18 milliards actifs par jeton, doté d'une fenêtre de contexte d'un million de jetons, avec des poids publiés sur Hugging Face sous licence MIT et — une première dans la lignée GLM-5 — une multimodalité native : l'image et la vidéo sont traitées par le modèle de base et non par une couche greffée. L'architecture associe une attention linéaire pour les dépendances locales à une attention parcimonieuse pour le contexte lointain ; à pleine longueur, un composant nommé IndexPool comprime les vecteurs clés de l'indexeur pour éviter que latence et mémoire n'explosent. Z.ai indique un entraînement sur un corpus multimodal d'environ 30 000 milliards de jetons. Selon ses propres chiffres, le modèle obtient 63,4 sur DeepSWE v1.1 contre 46,2 pour GLM-5.2, 48,8 sur AutomationBench contre 26,2, et 84,3 sur Terminal-Bench 2.1 face aux 85,0 de Claude Opus 4.8. Le tarif est de 0,15 dollar par million de jetons en entrée, 0,03 en cache et 0,50 en sortie, soit environ un dixième de GLM-5.2, avec une promotion de 50 % jusqu'au 9 septembre. L'affirmation qui fera le plus débat : Z.ai déclare que l'ensemble de la préversion Ox Alpha a été servie sur des accélérateurs chinois de production nationale, via son propre moteur d'inférence, avec un gain de bout en bout d'environ trois fois sur des dizaines de milliers d'unités. Tous les chiffres de référence sont déclarés par l'entreprise et n'ont pas été reproduits de façon indépendante.
Pourquoi c'est importantDeux choses distinctes se sont produites ici, et il vaut mieux les séparer. La première est un événement de prix : un modèle de 320 milliards de paramètres qui répond aux tests de code et d'agents à un ou deux points d'un modèle frontière fermé, publié sous MIT — la licence la plus permissive qui existe, c'est-à-dire intégrable dans un produit commercial sans demander l'autorisation de qui que ce soit — et à environ un dixième du coût de son prédécesseur. Cela efface l'écart entre ce que l'on loue et ce que l'on peut faire tourner soi-même, et précisément dans les catégories pour lesquelles les entreprises paient. La seconde est l'affirmation matérielle, et elle mérite plus de scepticisme que les résultats. Les contrôles à l'exportation reposent sur l'idée que le calcul avancé est le goulot d'étranglement. Si un laboratoire peut servir un modèle proche de la frontière à un public mondial de testeurs entièrement sur du silicium national, cette prémisse se rétrécit — mais uniquement du côté de l'inférence. Celle-ci est bien moins exigeante que l'entraînement, on ignore quelles puces et avec quelle efficacité, et la seule source est l'entreprise qui tire profit du récit. À noter, pas à parier.
✓ Vérifié · 5 sources
Lire dans l'app — gratuit, en 9 langues
Actus liées
Les nouveaux modèles ouverts d'IBM n'ont pas appris à décrire un terminal : on les a entraînés en s'en servant
2026-08-27Le modèle anonyme qui a avalé 42 000 milliards de jetons en six jours a un propriétaire : Z.ai reconnaît qu'Ox Alpha est un GLM et ouvre les poids
2026-08-26L'aperçu de Qwen4 est ouvert : six milliards de paramètres actifs par jeton et, dans le tableau publié par Alibaba, plus de vrais bugs corrigés qu'Opus 4.6
2026-08-26Un agent qui continue de réfléchir quand vous arrêtez d'écrire — et tout le harnais tient en moins de 10 000 lignes de Bash
2026-08-26Montrez au robot une vidéo d'une tâche de dix minutes, et il fait la tâche de dix minutes — sans réentraînement, sans rien taper
2026-08-26