Le cabinet d'évaluation Robocurve a confié un bras robotisé à trois modèles, avec cinq consignes dangereuses. Le GPT-6 Astra d'OpenAI a refusé 2 fois sur 100 et a mené l'action dangereuse 60 fois. Le modèle d'Anthropic a refusé 20 fois, et un modèle de recherche ouvert jamais.