Forschung
2026-08-07
'Genehmigen'? 40.000 Spielrunden zeigen: Menschen winken jeden dritten gefährlichen KI-Agenten-Befehl durch
Die Entwicklerwerkzeug-Firma Scale X machte aus den Berechtigungsabfragen von KI-Agenten ein Browserspiel — und wertete über 40.000 Runden mit 409.000 Genehmigen/Ablehnen-Entscheidungen aus. Die mittlere Trefferquote lag bei 66,3 Prozent: Spieler genehmigten rund jeden dritten bösartigen Befehl, ein Drittel der Sitzungen endete mit negativem Punktestand. Die Wachsamkeit sank mit jeder weiteren Genehmigung; die am häufigsten übersehene Gefahr — ein 'npm run analyze'-Skript, das beliebigen Code ausführen kann — wurde in fast 65 Prozent der Fälle durchgewunken.
Warum es wichtig ist'Ein Mensch genehmigt jeden Befehl' ist die Standardantwort der Branche auf die Sicherheit von KI-Agenten. Dies ist der größte öffentliche Datensatz, der zeigt, wie stark diese Absicherung unter Ermüdung leckt — genau der Fehlermodus, den Regulierer und Labore ausblenden. Echter Schutz braucht wohl Sandboxing und besseres Berechtigungsdesign, nicht mehr Klicks.
✓ Verifiziert · 2 Quellen
In der App lesen — kostenlos, 9 Sprachen
Verwandte Meldungen
Maschinelles Lernen las die Form kranker Hirnzellen — und wählte neun bereits zugelassene Medikamente aus, die sie beruhigten
2026-08-21Gerücht: Das anonyme Modell, das gerade gratis einen Coding-Benchmark anführte, soll Zhipus unveröffentlichtes Spitzenmodell sein
2026-08-21DeepSeeks günstiges Arbeitspferd kann jetzt sehen — bei Agentenaufgaben mit Bildern will es nahe an Anthropics Bestem sein
2026-08-21Nvidia zahlt 6 Milliarden Dollar für die Maschine, die die Modelle eines Konkurrenten baut — und stellt 109 der Leute ein, die sie bedienten
2026-08-21Vier Stunden und eine GPU, um die Art zu verbessern, wie KI trainiert wird: Der beste Agent kam auf 0,25 von 1 — und die meisten versuchten es gar nicht erst
2026-08-21