Forschung
AI Minute Newsroom
2026-08-22
Das Modell allein kam auf 30 Prozent. Eingebettet in Nvidias Gerüst löste dasselbe Modell alles.
Nvidia veröffentlichte am 21. August die Ergebnisse von AVO, kurz für Agentic Variation Operators, einem universellen Coding-Agentensystem, das alle 183 Level in allen 25 Umgebungen des öffentlichen Satzes von ARC-AGI-3 abschloss, dem Benchmark für interaktives Schlussfolgern, mit 100,00 Punkten auf dessen Maß für Handlungseffizienz im Verhältnis zum Menschen. Diese Umgebungen geben dem Agenten keine Anweisungen, keine ausgesprochenen Regeln und kein Ziel; er muss beim Spielen herausfinden, worum es überhaupt geht. Das denkende Sprachmodell war Anthropics Claude Opus 5, das allein und mit hohem Schlussfolgerungsaufwand im selben Satz nur rund 30 Prozent erreicht. AVO benötigte 6.624 Aktionen, etwa 12 Prozent weniger als VISTA, das bisherige Bestergebnis. Nvidia weist darauf hin, dass der Lauf allein den öffentlichen Satz mit 25 Umgebungen abdeckt, nicht die halbprivaten oder privaten Wettbewerbssätze.
Warum es wichtig istZwei Jahre lang lautete die Annahme, Fortschritt komme mit dem nächsten Modell. Dieses Ergebnis sagt, dass ein großer Teil davon inzwischen aus der Software stammt, die man um ein bereits käufliches Modell herumlegt: Gedächtnis, Planung, Aufsicht und eine Schleife, die die eigene Arbeit prüft und erneut ansetzt. Dieselben Gewichte gingen ohne Nachtraining von einem Drittel des Benchmarks auf das Ganze. Das verschiebt, wo Ingenieursarbeit hingehört, und macht die Frage, welches Modell ein Produkt verwendet, zu einem deutlich schwächeren Hinweis darauf, was dieses Produkt tatsächlich kann.
✓ Verifiziert · 3 Quellen
▶ Passendes Video: Interactive Reasoning Benchmarks | ARC-AGI-3 Preview
In der App lesen — kostenlos, 9 Sprachen
Verwandte Meldungen
Ein Modell lernte ohne das Verfahren, das jede KI trainiert.
2026-10-06TikTok steckt einen Einkaufsbot in das Video, das Sie ansehen.
2026-10-06Reflection verschenkt ein Modell mit 501 Milliarden Parametern.
2026-10-06Wikimedia verdächtigt OpenAI-Agenten für die Störung im Mai.
2026-10-06Metas Assistent führt eine Stundenakte über alle Ihre Bekannten.
2026-10-05