aiminute. ← सभी AI समाचार
अनुसंधान AI Minute Newsroom 2026-10-09

नया स्कोरकार्ड नापता है कि एजेंट कितनी बार बिन कहे काम करते हैं।

नया स्कोरकार्ड नापता है कि एजेंट कितनी बार बिन कहे काम करते हैं।

एआई मूल्यांकन कंपनी Arena ने गुरुवार को अलाइनमेंट इंडेक्स जारी किया और 20 करोड़ डॉलर जुटाए। उसने 90,000 असली एजेंट सत्रों में 27 मॉडल परखे और बिन अनुमति काम को आधा भार दिया। OpenAI का GPT-6.1 Sol 87.9 अंक से आगे रहा और उसके ठीक पीछे Claude Opus 5.5 था।

यह क्यों मायने रखता हैआपके लिए बुकिंग या खरीद करने वाला एजेंट चुपचाप हद पार कर सकता है। तटस्थ स्कोर से आप कंपनियों को रफ़्तार के बजाय बर्ताव पर परख सकते हैं।
#AI एजेंट

✓ सत्यापित · 4 स्रोत

▶ संबंधित वीडियो: Why agent evals need to go beyond human preference
WhatsApp X Telegram
ऐप में पढ़ें — मुफ़्त, 9 भाषाएँ

संबंधित खबरें

ओपनएआई के सस्ते मॉडल में छह गुना महँगा तेज़ मोड आया।
2026-10-09
गूगल के मेडिकल एआई ने डॉक्टर से पहले मरीज़ों से बात की।
2026-10-09
1.8 अरब डॉलर का कोशिका डेटा पहले उसके दानदाता इस्तेमाल करेंगे।
2026-10-09
गूगल का नया दफ़्तरी एजेंट प्रतिद्वंद्वी के Claude पर भी चलता है।
2026-10-09
एक चिह्न की गलती ने OpenAI के तीन गणित पर्चे गिरा दिए।
2026-10-08