aiminute. ← Alle KI-News
Forschung AI Minute Newsroom 2026-09-02

Anthropic fand Fehler in mehr als jeder zehnten Trainingsumgebung.

Anthropic fand Fehler in mehr als jeder zehnten Trainingsumgebung.

Anthropic veröffentlichte am 31. August eine Bilanz seiner Arbeit an Ausrichtung und Sicherheit. Mehr als 10 Prozent der Umgebungen für bestärkendes Lernen waren kaputt oder für Belohnungstricks offen. Das Unternehmen fror Änderungen einen Monat ein und schob 150 Ingenieure in die Sicherheit.

Warum es wichtig istModelle lernen ihre Gewohnheiten in diesen Übungsumgebungen, eine kaputte lehrt das Falsche. Selten zählt ein Labor die eigenen Mängel öffentlich auf.

✓ Verifiziert · 2 Quellen

WhatsApp X Telegram
In der App lesen — kostenlos, 9 Sprachen

Verwandte Meldungen

OpenAIs nächstes Modell denkt in Schleifen mit wenig Spur.
2026-09-03
Perplexity zitiert 215.128 Ratgeber von drei verbundenen Websites.
2026-09-02
Ein Entwickler schlug viele Chatbots für 67 Cent Rechenleistung.
2026-09-02
Der beste KI-Agent schaffte 30% der echten Laborarbeit
2026-08-29
Claude schlug menschliche Forscher beim Schließen von Alignment-Lücken
2026-08-29