Nouveaux Modèles
2026-08-20
Le modèle invente ses propres exercices, construit le banc d'essai qui les évalue, puis s'entraîne sur le résultat — et DeepReinforce a donné les poids
DeepReinforce a publié Ornith-1.5 le 19 août en trois tailles à poids ouverts : un mélange d'experts de 397 milliards de paramètres, un modèle de 35 milliards qui en active 3 milliards par jeton, et un modèle dense de 9 milliards, tous sous licence MIT, les poids étant sur Hugging Face. L'intéressant n'est pas la taille. Plutôt que d'apprendre à partir d'un ensemble figé de tâches écrites par des humains, le modèle propose les siennes, note chacune sur la validité, la difficulté et la nouveauté, écrit lui-même l'échafaudage nécessaire pour l'exécuter, puis produit des tentatives de solution qui réalimentent l'apprentissage par renforcement. L'équipe parle de boucler le passage de l'auto-échafaudage à l'auto-amélioration. Selon les chiffres du laboratoire, le modèle 397B obtient 86,1 sur Terminal-Bench 2.1 et 56,0 sur DeepSWE, contre 85,0 et 59,0 pour Claude Opus 4.8 et 82,7 et 46,2 pour GLM-5.2 ; il annonce 92,8 sur GPQA Diamond. La fenêtre de contexte est de 262 144 jetons et le modèle complet pèse environ 800 gigaoctets en BF16 : ouvert ne veut donc pas dire qu'il tourne sur votre portable. C'est la version 9B qui le fait, avec 47,0 sur Terminal-Bench 2.1 et 70,6 sur SWE-bench Verified.
Pourquoi c'est importantTous les laboratoires disent désormais que les bons problèmes d'entraînement viennent à manquer. Voici une réponse : que le modèle écrive lui-même le programme. Si cela tient, le plafond de capacité cesse d'être le nombre de problèmes valables qu'un humain sait rédiger et devient la finesse avec laquelle un modèle juge qu'un problème qu'il vient d'inventer mérite d'être résolu — goulot plus inconfortable, car un système qui note sa propre difficulté peut dériver vers des problèmes durs et sans intérêt. Ce sont par ailleurs les chiffres de DeepReinforce sur des tests choisis par DeepReinforce, et aucune évaluation indépendante n'est encore parue. Ce qui n'est pas contestable, c'est la licence : un modèle sous MIT qui revendique la parité avec un modèle phare sur le travail d'agent en terminal, c'est un plancher relevé en public, et quiconque vend l'accès à un modèle fermé doit désormais se situer par rapport à lui.
✓ Vérifié · 4 sources
▶ Vidéo associée: Ornith-1.5 Ships 9B Dense, 35B and 397B MoE Models | Models & Agents #Shorts
Lire dans l'app — gratuit, en 9 langues
Actus liées
Rumeur : le modèle anonyme qui vient de dominer un test de programmation, gratuitement, serait le fleuron non publié de Zhipu
2026-08-21Le cheval de trait bon marché de DeepSeek voit désormais — et sur les tâches d'agent qui exigent des yeux, il se dit proche du meilleur d'Anthropic
2026-08-21Nvidia paie 6 milliards de dollars pour la machine qui fabrique les modèles d'un rival — et embauche 109 de ceux qui la faisaient tourner
2026-08-21Quatre heures et un GPU pour améliorer la façon dont on entraîne l'IA : le meilleur agent obtient 0,25 sur 1 — et la plupart n'ont même pas essayé
2026-08-21ChatGPT peut désormais lire vos iMessages et les envoyer — et le réglage qui lui évite de demander est celui-là même dont OpenAI met en garde
2026-08-21