aiminute. ← Alle KI-News
Forschung 2026-08-22

Das Modell allein kam auf 30 Prozent. Eingebettet in Nvidias Gerüst löste dasselbe Modell alles.

Das Modell allein kam auf 30 Prozent. Eingebettet in Nvidias Gerüst löste dasselbe Modell alles.

Nvidia veröffentlichte am 21. August die Ergebnisse von AVO, kurz für Agentic Variation Operators, einem universellen Coding-Agentensystem, das alle 183 Level in allen 25 Umgebungen des öffentlichen Satzes von ARC-AGI-3 abschloss, dem Benchmark für interaktives Schlussfolgern, mit 100,00 Punkten auf dessen Maß für Handlungseffizienz im Verhältnis zum Menschen. Diese Umgebungen geben dem Agenten keine Anweisungen, keine ausgesprochenen Regeln und kein Ziel; er muss beim Spielen herausfinden, worum es überhaupt geht. Das denkende Sprachmodell war Anthropics Claude Opus 5, das allein und mit hohem Schlussfolgerungsaufwand im selben Satz nur rund 30 Prozent erreicht. AVO benötigte 6.624 Aktionen, etwa 12 Prozent weniger als VISTA, das bisherige Bestergebnis. Nvidia weist darauf hin, dass der Lauf allein den öffentlichen Satz mit 25 Umgebungen abdeckt, nicht die halbprivaten oder privaten Wettbewerbssätze.

Warum es wichtig istZwei Jahre lang lautete die Annahme, Fortschritt komme mit dem nächsten Modell. Dieses Ergebnis sagt, dass ein großer Teil davon inzwischen aus der Software stammt, die man um ein bereits käufliches Modell herumlegt: Gedächtnis, Planung, Aufsicht und eine Schleife, die die eigene Arbeit prüft und erneut ansetzt. Dieselben Gewichte gingen ohne Nachtraining von einem Drittel des Benchmarks auf das Ganze. Das verschiebt, wo Ingenieursarbeit hingehört, und macht die Frage, welches Modell ein Produkt verwendet, zu einem deutlich schwächeren Hinweis darauf, was dieses Produkt tatsächlich kann.
#Coding#KI-Agenten

✓ Verifiziert · 3 Quellen

▶ Passendes Video: Interactive Reasoning Benchmarks | ARC-AGI-3 Preview
WhatsApp X Telegram
In der App lesen — kostenlos, 9 Sprachen

Verwandte Meldungen

Drei Viertel der Amerikaner wollen kein Rechenzentrum in ihrer Nähe. Vor einem Jahr war das Land noch geteilt.
2026-08-22
Anthropic lässt sein stärkstes Modell Fehler in Ihrem Code jagen, aber nicht mit Ihnen sprechen
2026-08-22
Maschinelles Lernen las die Form kranker Hirnzellen — und wählte neun bereits zugelassene Medikamente aus, die sie beruhigten
2026-08-21
Gerücht: Das anonyme Modell, das gerade gratis einen Coding-Benchmark anführte, soll Zhipus unveröffentlichtes Spitzenmodell sein
2026-08-21
DeepSeeks günstiges Arbeitspferd kann jetzt sehen — bei Agentenaufgaben mit Bildern will es nahe an Anthropics Bestem sein
2026-08-21