aiminute. ← Toute l’actu IA
Rumeurs AI Minute Newsroom 2026-08-21

Rumeur : le modèle anonyme et gratuit est toujours dit être celui de Zhipu — mais le score qui l'a rendu célèbre portait sur dix tâches, et le test complet est banal

Rumeur : le modèle anonyme et gratuit est toujours dit être celui de Zhipu — mais le score qui l'a rendu célèbre portait sur dix tâches, et le test complet est banal

Il s'agit d'une rumeur non vérifiée, publiée comme telle. Un modèle nommé Ox Alpha est apparu sur OpenRouter le 20 août sous un fournisseur anonyme étiqueté seulement « Stealth » : gratuit pendant une semaine, avec une fenêtre de contexte de 1 048 576 jetons, jusqu'à 131 072 jetons en sortie, et des entrées texte, image et vidéo. Le 21 août, le chercheur Ben Davis a publié une analyse d'empreinte affirmant être « sûr à 99 % » que le modèle est un membre non publié de la famille GLM-5 de Zhipu : consommation de jetons de l'encodeur vidéo identique à GLM-5V-Turbo, tokeniseur correspondant à GLM-5.3 hormis une enveloppe fixe de 75 jetons, même comportement de refus sur l'entrée audio, même code d'erreur « 1301 » et taux d'émojis comparable en sortie. Selon lui, l'analyse écarte Xiaomi MiMo, DeepSeek, Google, Qwen, xAI, OpenAI et Anthropic. Rien n'est confirmé : au 23 août, aucune entreprise n'a revendiqué Ox Alpha et Zhipu n'a rien dit. Notez aussi la question des données. La fiche du modèle sur OpenRouter indique que les requêtes et les réponses envoyées à Ox Alpha sont conservées par le fournisseur anonyme, sans être utilisées pour l'entraînement — tandis qu'OpenCode a promu le même modèle comme sans conservation de données. Tant que le fournisseur n'est pas nommé, l'hypothèse prudente est que ce que vous envoyez est conservé par une entreprise qui ne vous a pas dit son nom. (Correction, 23 août : notre article initial indiquait qu'Ox Alpha obtenait 80 % de pass@1 au benchmark de programmation DeepSWE, devant Claude Fable 5 à 65 %, GLM-5.3 à 62 % et GPT-5.6-sol à 52 %. Ce chiffre provenait d'un sous-ensemble de 10 tâches, moins de 9 % du benchmark. Davis a depuis exécuté l'ensemble complet de 113 tâches et obtenu environ 63 %, au niveau de GPT-5.6 Sol et non devant le peloton ; il dit lui-même que le chiffre sur l'ensemble complet est celui qui a du sens. Ox Alpha n'a pas dominé le benchmark. Notre titre affirmait le contraire, et c'était faux.)

Pourquoi c'est importantLa correction est l'information. Un résultat sur dix tâches a fait le tour du monde en deux jours sous la forme « un modèle anonyme domine un benchmark de programmation » ; le résultat sur 113 tâches qui le contredit n'ira pas aussi loin. Chaque fois qu'un modèle devance nettement tous les autres, la première question est de savoir combien de problèmes lui ont réellement été soumis : un petit échantillon produit des écarts grands, excitants et dénués de sens. Le reste tient toujours : l'identité n'est pas prouvée, et lancer un modèle puissant de façon anonyme et gratuite pendant une semaine est un canal de distribution, pas un cadeau. Le banc d'essai, c'est vous, et ici le fournisseur dit qu'il conserve ce que vous envoyez.
#Code

⚠ Rumeur non vérifiée — prudence

WhatsApp X Telegram
Lire dans l'app — gratuit, en 9 langues

Actus liées

OpenAI promet une amélioration par jour sinon il remet vos quotas.
2026-10-05
Un déluge de rapports écrits par IA a gelé les primes de Google.
2026-10-04
Anthropic paiera pour former 10 000 ingénieurs à déployer Claude.
2026-10-04
Un bureau Linux a totalement refusé le code écrit par une IA.
2026-10-04
DeepSeek a posé son agent sur votre bureau et ouvert le code.
2026-10-03