Neue Modelle
2026-08-20
Das Modell erfindet seine eigenen Aufgaben, baut den Prüfstand dafür und trainiert dann mit dem Ergebnis — und DeepReinforce hat die Gewichte verschenkt
DeepReinforce hat Ornith-1.5 am 19. August in drei offenen Gewichtsgrößen veröffentlicht: ein Expertengemisch mit 397 Milliarden Parametern, ein 35-Milliarden-Modell, das pro Token 3 Milliarden Parameter aktiviert, und ein dichtes 9-Milliarden-Modell — alle unter MIT-Lizenz, die Gewichte auf Hugging Face. Interessant sind nicht die Größen. Statt aus einem festen Satz von Menschen geschriebener Aufgaben zu lernen, schlägt das Modell eigene vor, bewertet jede nach Gültigkeit, Schwierigkeit und Neuheit, schreibt selbst das Gerüst, um sie auszuführen, und erzeugt Lösungsversuche, die ins bestärkende Lernen zurückfließen. Das Team nennt das den geschlossenen Kreis vom Selbstgerüst zur Selbstverbesserung. Nach den eigenen Zahlen des Labors erreicht das 397B-Modell 86,1 auf Terminal-Bench 2.1 und 56,0 auf DeepSWE, gegenüber 85,0 und 59,0 bei Claude Opus 4.8 und 82,7 und 46,2 bei GLM-5.2; für GPQA Diamond werden 92,8 angegeben. Das Kontextfenster umfasst 262.144 Token, und das vollständige Modell wiegt in BF16 rund 800 Gigabyte — offen heißt hier also nicht, dass es auf dem Laptop läuft. Das tut die 9B-Version, mit 47,0 auf Terminal-Bench 2.1 und 70,6 auf SWE-bench Verified.
Warum es wichtig istInzwischen sagt jedes Labor, die guten Trainingsaufgaben gingen zur Neige. Dies ist eine Antwort darauf: Das Modell soll den Lehrplan selbst schreiben. Falls das trägt, ist die Obergrenze der Fähigkeit nicht mehr, wie viele brauchbare Aufgaben Menschen formulieren können, sondern wie gut ein Modell beurteilt, ob eine selbst erfundene Aufgabe das Lösen wert ist — ein unbequemerer Engpass, denn ein System, das seine eigene Schwierigkeit benotet, kann zu Aufgaben abdriften, die schwer und zugleich sinnlos sind. Zudem sind das DeepReinforce-Zahlen auf von DeepReinforce gewählten Tests; eine unabhängige Auswertung fehlt noch. Unstrittig ist die Lizenz: Ein MIT-lizenziertes Modell, das bei Terminal-Agentenarbeit Gleichstand mit einem Flaggschiff beansprucht, hebt öffentlich den Boden an — und wer Zugang zu einem geschlossenen Modell verkauft, muss sich nun daran messen lassen.
✓ Verifiziert · 4 Quellen
▶ Passendes Video: Ornith-1.5 Ships 9B Dense, 35B and 397B MoE Models | Models & Agents #Shorts
In der App lesen — kostenlos, 9 Sprachen
Verwandte Meldungen
Gerücht: Das anonyme Modell, das gerade gratis einen Coding-Benchmark anführte, soll Zhipus unveröffentlichtes Spitzenmodell sein
2026-08-21DeepSeeks günstiges Arbeitspferd kann jetzt sehen — bei Agentenaufgaben mit Bildern will es nahe an Anthropics Bestem sein
2026-08-21Nvidia zahlt 6 Milliarden Dollar für die Maschine, die die Modelle eines Konkurrenten baut — und stellt 109 der Leute ein, die sie bedienten
2026-08-21Vier Stunden und eine GPU, um die Art zu verbessern, wie KI trainiert wird: Der beste Agent kam auf 0,25 von 1 — und die meisten versuchten es gar nicht erst
2026-08-21ChatGPT kann jetzt Ihre iMessages lesen und verschicken — und die Einstellung, mit der es das Nachfragen überspringt, ist genau die, vor der OpenAI warnt
2026-08-21