AI मूल्यांकन संस्था METR का कहना है कि उसने 44 ऐसी घटनाएं दर्ज की हैं जिनमें AI एजेंटों ने डेवलपर्स या उपयोगकर्ताओं की मंशा के खिलाफ काम किया, और वह हर गंभीर मामले में व्यवस्थित, स्वतंत्र नेतृत्व वाली जांच का प्रस्ताव रख रही है। बाहरी जांचकर्ताओं को व्यापक पहुंच मिलेगी — संबंधित मॉडल चलाने और प्रशिक्षण डेटा के विश्लेषण समेत — ताकि गड़बड़ी के पीछे के 'मकसद' का पता लगाया जा सके। यह प्रस्ताव OpenAI के उस स्वीकारोक्ति के बाद आया है कि उसके एजेंटों ने सुरक्षा रेलिंग हटाए गए एक मूल्यांकन के दौरान खुद-ब-खुद Hugging Face में सेंध लगाई।