aiminute. ← Toute l’actu IA
Nouveaux Modèles AI Minute Newsroom 2026-08-20

Le modèle invente ses propres exercices, construit le banc d'essai qui les évalue, puis s'entraîne sur le résultat — et DeepReinforce a donné les poids

Le modèle invente ses propres exercices, construit le banc d'essai qui les évalue, puis s'entraîne sur le résultat — et DeepReinforce a donné les poids

DeepReinforce a publié Ornith-1.5 le 19 août en trois tailles à poids ouverts : un mélange d'experts de 397 milliards de paramètres, un modèle de 35 milliards qui en active 3 milliards par jeton, et un modèle dense de 9 milliards, tous sous licence MIT, les poids étant sur Hugging Face. L'intéressant n'est pas la taille. Plutôt que d'apprendre à partir d'un ensemble figé de tâches écrites par des humains, le modèle propose les siennes, note chacune sur la validité, la difficulté et la nouveauté, écrit lui-même l'échafaudage nécessaire pour l'exécuter, puis produit des tentatives de solution qui réalimentent l'apprentissage par renforcement. L'équipe parle de boucler le passage de l'auto-échafaudage à l'auto-amélioration. Selon les chiffres du laboratoire, le modèle 397B obtient 86,1 sur Terminal-Bench 2.1 et 56,0 sur DeepSWE, contre 85,0 et 59,0 pour Claude Opus 4.8 et 82,7 et 46,2 pour GLM-5.2 ; il annonce 92,8 sur GPQA Diamond. La fenêtre de contexte est de 262 144 jetons et le modèle complet pèse environ 800 gigaoctets en BF16 : ouvert ne veut donc pas dire qu'il tourne sur votre portable. C'est la version 9B qui le fait, avec 47,0 sur Terminal-Bench 2.1 et 70,6 sur SWE-bench Verified.

Pourquoi c'est importantTous les laboratoires disent désormais que les bons problèmes d'entraînement viennent à manquer. Voici une réponse : que le modèle écrive lui-même le programme. Si cela tient, le plafond de capacité cesse d'être le nombre de problèmes valables qu'un humain sait rédiger et devient la finesse avec laquelle un modèle juge qu'un problème qu'il vient d'inventer mérite d'être résolu — goulot plus inconfortable, car un système qui note sa propre difficulté peut dériver vers des problèmes durs et sans intérêt. Ce sont par ailleurs les chiffres de DeepReinforce sur des tests choisis par DeepReinforce, et aucune évaluation indépendante n'est encore parue. Ce qui n'est pas contestable, c'est la licence : un modèle sous MIT qui revendique la parité avec un modèle phare sur le travail d'agent en terminal, c'est un plancher relevé en public, et quiconque vend l'accès à un modèle fermé doit désormais se situer par rapport à lui.
#Code#Agents IA

✓ Vérifié · 4 sources

▶ Vidéo associée: Ornith-1.5 Ships 9B Dense, 35B and 397B MoE Models | Models & Agents #Shorts
WhatsApp X Telegram
Lire dans l'app — gratuit, en 9 langues

Actus liées

Le nouveau modèle de Microsoft écrit avant que vous ayez fini.
2026-10-05
Un laboratoire américain va offrir un modèle de niveau chinois.
2026-10-05
L'assistant de Meta tient une fiche horaire sur vos proches.
2026-10-05
Deux sénateurs veulent la prison pour les patrons d'agents pirates.
2026-10-05
Un site de vidéo offre le meilleur modèle ouvert de traduction.
2026-10-05