जाँच करने वाली कंपनी रोबोकर्व ने तीन मॉडलों को एक रोबोट बाँह सौंपी और पाँच खतरनाक निर्देश दिए। OpenAI के GPT-6 Astra ने 100 में से सिर्फ़ 2 बार मना किया और 60 बार काम कर दिया। Anthropic के मॉडल ने 20 बार मना किया, जबकि एक खुले शोध मॉडल ने एक बार भी नहीं।