aiminute. ← Alle KI-News
Forschung AI Minute Newsroom 2026-08-23

Ein älteres Claude verstieß in 10 von 10 Versuchen gegen Anthropics eigene Inhaltsregel — und wird weiterhin über Azure und Bedrock verkauft

Ein älteres Claude verstieß in 10 von 10 Versuchen gegen Anthropics eigene Inhaltsregel — und wird weiterhin über Azure und Bedrock verkauft

TechCrunch berichtete am 21. August, dass Claude Opus 4.6, ein älteres Modell, das Anthropic weiterhin bereitstellt, in 10 von 10 direkten Anfragen sexuell explizites Material erzeugte — Inhalte, die die eigene Nutzungsrichtlinie des Unternehmens verbietet. Die Methode war kein technischer Exploit, sondern ein gesprächlicher: ein Rollenspielszenario, das Stück für Stück gesteigert wird, bis die Verweigerung schlicht ausbleibt — ein Muster, das Tester Grenzerosion nennen. Opus 3 und Haiku 4.5 gaben demselben Vorgehen nach. Modelle ab Opus 4.7, einschließlich Opus 5, hielten stand. Anthropic teilte TechCrunch mit, dass Nutzer, die Rollenspiele in Richtung unangemessener Ausgaben lenken, „eine branchenweit bekannte Herausforderung“ seien, dass die Schutzmechanismen mit jedem Modellstart besser würden und dass sexuelles oder romantisches Rollenspiel weniger als 0,1 Prozent aller Gespräche ausmache. Der Forscher, der das Verhalten über Anthropics Bug-Bounty-Programm meldete, sagt, er habe nur automatische Antworten erhalten. Opus 4.6, Opus 3 und Haiku 4.5 sind weiterhin über Anthropics API verfügbar, Opus 4.6 und Haiku 4.5 zudem über Microsofts Azure Foundry und Amazon Bedrock.

Warum es wichtig istFast die gesamte Sicherheitsberichterstattung dreht sich um das neueste Modell. Hier geht es um die darunter — und dort läuft der meiste Produktionsverkehr. Unternehmen bleiben aus Preis- oder Stabilitätsgründen auf einer älteren Version und erben deren Leitplanken, nicht die dieses Monats. Wer Opus 4.6 über einen Cloud-Marktplatz kauft, kauft die Sicherheitsarbeit seines Erscheinungsdatums. Der zweite Punkt ist, wie das Versagen heute aussieht: keine Jailbreak-Zeichenkette, keine Prompt-Injection, nur ein langes, höfliches Gespräch, das die Grenze jedes Mal um ein paar Zentimeter verschiebt. Filter sind darauf gebaut, eine schlechte Anfrage abzufangen. Gegen hundert vernünftige Anfragen hintereinander sind sie deutlich schwächer.

✓ Verifiziert · 2 Quellen

WhatsApp X Telegram
In der App lesen — kostenlos, 9 Sprachen

Verwandte Meldungen

Wenn ein kleines Modell das Gespräch an ein großes übergibt, liest das große alles noch einmal. Nvidia sagt, eine Gerade könne die Übersetzung erledigen.
2026-08-23
Ein Modell mit 27 Milliarden Parametern schlug Opus 4.8 und GPT-5.5 beim Reproduzieren veröffentlichter Arbeiten
2026-08-23
Gib einem Modell das Literaturverzeichnis eines unveröffentlichten Papiers und frage, was darin steht. Die besten treffen in 15 Prozent der Fälle.
2026-08-22
Drei Viertel der Amerikaner wollen kein Rechenzentrum in ihrer Nähe. Vor einem Jahr war das Land noch geteilt.
2026-08-22
Das Modell allein kam auf 30 Prozent. Eingebettet in Nvidias Gerüst löste dasselbe Modell alles.
2026-08-22