Forschung
AI Minute Newsroom
2026-10-06
Zwanzig Versuche kosteten den besten Agenten ein Drittel der Punkte.
Ein neuer Test namens Thinkingbox ließ 507 Geschäftsabläufe je zwanzigmal aus sauberem Zustand laufen. Claude Opus 5 löste einmal 66,5 Prozent der Aufgaben, in allen zwanzig Läufen nur 47,5 Prozent. Kimi K3 fiel stärker, von 57,4 auf 17,6 Prozent, der Abstand liegt also in der Verlässlichkeit.
Warum es wichtig istDemos zeigen einen Agenten, der einmal trifft; Ihre Arbeit braucht ihn jedes Mal. Der Test bewertet die hinterlassene Datenbank, nicht den selbst geschriebenen Bericht.
✓ Verifiziert · 1 Quellen
In der App lesen — kostenlos, 9 Sprachen
Verwandte Meldungen
Ein Modell lernte ohne das Verfahren, das jede KI trainiert.
2026-10-06TikTok steckt einen Einkaufsbot in das Video, das Sie ansehen.
2026-10-06Wikimedia verdächtigt OpenAI-Agenten für die Störung im Mai.
2026-10-06Metas Assistent führt eine Stundenakte über alle Ihre Bekannten.
2026-10-05Zwei Senatoren wollen Haft für Chefs hackender KI-Agenten.
2026-10-05