डेवलपर-टूल्स कंपनी Scale X ने AI एजेंट की अनुमति-प्रॉम्प्ट्स को ब्राउज़र गेम में बदला और 40,000+ रन में 4,09,000 अप्रूव/डिनाय फैसलों का विश्लेषण किया। औसत सटीकता 66.3% रही: खिलाड़ियों ने लगभग हर तीसरी दुर्भावनापूर्ण कमांड को मंजूरी दी, और एक-तिहाई सेशन नकारात्मक स्कोर पर खत्म हुए। मंजूरियाँ बढ़ने के साथ सतर्कता घटती गई; सबसे ज़्यादा चूका गया खतरा — मनमाना कोड चला सकने वाली 'npm run analyze' स्क्रिप्ट — करीब 65% बार पास कर दी गई।