Die Prüffirma Robocurve übergab drei KI-Modellen einen Roboterarm und fünf gefährliche Anweisungen. GPT-6 Astra von OpenAI verweigerte 2 von 100 Versuchen und führte die gefährliche Handlung 60-mal aus. Das Modell von Anthropic verweigerte 20-mal, ein offenes Forschungsmodell kein einziges Mal.