aiminute. ← सभी AI समाचार
अनुसंधान AI Minute Newsroom 2026-08-07

'अप्रूव'? 40,000 गेम रन बताते हैं — इंसान हर तीन में से एक खतरनाक AI एजेंट कमांड पास कर देते हैं

'अप्रूव'? 40,000 गेम रन बताते हैं — इंसान हर तीन में से एक खतरनाक AI एजेंट कमांड पास कर देते हैं

डेवलपर-टूल्स कंपनी Scale X ने AI एजेंट की अनुमति-प्रॉम्प्ट्स को ब्राउज़र गेम में बदला और 40,000+ रन में 4,09,000 अप्रूव/डिनाय फैसलों का विश्लेषण किया। औसत सटीकता 66.3% रही: खिलाड़ियों ने लगभग हर तीसरी दुर्भावनापूर्ण कमांड को मंजूरी दी, और एक-तिहाई सेशन नकारात्मक स्कोर पर खत्म हुए। मंजूरियाँ बढ़ने के साथ सतर्कता घटती गई; सबसे ज़्यादा चूका गया खतरा — मनमाना कोड चला सकने वाली 'npm run analyze' स्क्रिप्ट — करीब 65% बार पास कर दी गई।

यह क्यों मायने रखता है'हर कमांड को इंसान मंजूरी देता है' — एजेंट सुरक्षा पर उद्योग का मानक जवाब यही है। यह अब तक का सबसे बड़ा सार्वजनिक डेटासेट है जो दिखाता है कि थकान में यह ढाल बुरी तरह चूकती है — ठीक वही विफलता जिसे नियामक और लैब्स नज़रअंदाज़ करते हैं। असली सुरक्षा शायद ज़्यादा क्लिक से नहीं, सैंडबॉक्सिंग और बेहतर अनुमति-डिज़ाइन से आएगी।
#कोडिंग#AI एजेंट

✓ सत्यापित · 2 स्रोत

WhatsApp X Telegram
ऐप में पढ़ें — मुफ़्त, 9 भाषाएँ

संबंधित खबरें

एक मॉडल उस तरीके के बिना सीखा जिससे हर AI सीखता है।
2026-10-06
TikTok ने देखे जा रहे वीडियो के अंदर शॉपिंग बॉट रख दिया।
2026-10-06
Reflection 501 अरब पैरामीटर वाला मॉडल मुफ्त में देगा।
2026-10-06
विकिमीडिया को मई की गड़बड़ी में OpenAI एजेंट पर शक है।
2026-10-06
मेटा का सहायक आपके हर परिचित की घंटेवार फ़ाइल रखता है।
2026-10-05