aiminute. ← Alle KI-News
Forschung 2026-08-15

Aufgefordert, Code zu schreiben und ihn zugleich zu beweisen, schaffte der beste Agent 27 von 43 — und keinen der schweren

Aufgefordert, Code zu schreiben und ihn zugleich zu beweisen, schaffte der beste Agent 27 von 43 — und keinen der schweren

Ein Team, dem auch Dawn Song angehört, veröffentlichte am 13. August auf arXiv Vero, beschrieben als erster Benchmark für verifizierte Codesynthese auf Repository-Ebene. Statt von einem Agenten eine Funktion zu verlangen, die Tests besteht, verlangt Vero eine lauffähige Implementierung über eine mehrmodulige Codebasis hinweg plus einen maschinell prüfbaren Beweis, dass diese Implementierung einer formalen Spezifikation entspricht. Er enthält 43 aus echten Repositories gebaute Instanzen und umfasst Beweis- und Programmiersprachen wie Lean 4, Dafny, Verus und Coq sowie Domänen von kryptografischen Protokollen bis zu verteilten Systemen. Die stärkste von den Autoren getestete Agentenkonfiguration löste 27 der 43 vollständig und schloss auf den schwersten Repositories keine einzige Spezifikation.

Warum es wichtig istFast jede Behauptung, die man über Agenten und das Schreiben von Software liest, stützt sich darauf, dass Tests bestehen — und Tests decken nur die Fälle ab, die jemand zu schreiben eingefallen ist. Ein maschinell geprüfter Beweis ist die eine Form von Evidenz, der es gleichgültig ist, wie klug das Modell klang: Entweder der Beweis kompiliert oder nicht. Zum ersten Mal wurden Agenten an diesem Maßstab in der Größe eines ganzen Repositories gemessen, und die Antwort lautet: Sie schaffen die leichten zwei Drittel und rühren das schwere Drittel nicht an. Eine nützliche Zahl für das nächste Mal, wenn ein Coding-Agent als zuverlässig beschrieben wird.
#Coding#KI-Agenten

✓ Verifiziert · 1 Quellen

WhatsApp X Telegram
In der App lesen — kostenlos, 9 Sprachen

Verwandte Meldungen

Maschinelles Lernen las die Form kranker Hirnzellen — und wählte neun bereits zugelassene Medikamente aus, die sie beruhigten
2026-08-21
Gerücht: Das anonyme Modell, das gerade gratis einen Coding-Benchmark anführte, soll Zhipus unveröffentlichtes Spitzenmodell sein
2026-08-21
DeepSeeks günstiges Arbeitspferd kann jetzt sehen — bei Agentenaufgaben mit Bildern will es nahe an Anthropics Bestem sein
2026-08-21
Nvidia zahlt 6 Milliarden Dollar für die Maschine, die die Modelle eines Konkurrenten baut — und stellt 109 der Leute ein, die sie bedienten
2026-08-21
Vier Stunden und eine GPU, um die Art zu verbessern, wie KI trainiert wird: Der beste Agent kam auf 0,25 von 1 — und die meisten versuchten es gar nicht erst
2026-08-21