aiminute. ← सभी AI समाचार
अनुसंधान AI Minute Newsroom 2026-08-29

शोधकर्ताओं ने अपनी प्रयोगशाला के 70 असली काम परीक्षा के रूप में सौंप दिए। सबसे अच्छे एआई एजेंट ने उसका 30 प्रतिशत पूरा किया।

शोधकर्ताओं ने अपनी प्रयोगशाला के 70 असली काम परीक्षा के रूप में सौंप दिए। सबसे अच्छे एआई एजेंट ने उसका 30 प्रतिशत पूरा किया।

टर्मिनल-बेंच-साइंस 0.1, जिसे इस हफ़्ते स्टैनफोर्ड के शोधकर्ताओं ने टर्मिनल-बेंच और हार्बर टीमों के साथ जारी किया, एक ऐसा बेंचमार्क है जो उस काम से बना है जो वैज्ञानिक सचमुच करते हैं। इसके 70 कार्यों में से हर एक किसी शोधकर्ता ने दिया, जिसने अपनी ही प्रयोगशाला के एक कम्प्यूटेशनल वर्कफ़्लो को ऐसा रूप दिया जिसे कोई एजेंट टर्मिनल में आज़मा सके — जीव, भौतिक, पृथ्वी, गणितीय और अभियांत्रिकी विज्ञानों में। हर कार्य एक कंटेनर में चलता है और प्रोग्राम द्वारा जांचा जाता है, यानी अंक इस बात के हैं कि काम सही निकला या नहीं, न कि इस बात के कि एजेंट ने क्या दावा किया। नतीजे जान-बूझकर कम हैं: क्लॉड ओपस 5 सबसे आगे है, 30.0 प्रतिशत समाधान दर के साथ; जीपीटी-5.6 सोल को 22.4 प्रतिशत और क्लॉड फेबल 5 को 21.4 प्रतिशत मिला। हर मॉडल ने सामान्य टर्मिनल-बेंच 3.0 की तुलना में दस अंक से ज़्यादा कम स्कोर किया। परियोजना 22 देशों के 376 योगदानकर्ता सूचीबद्ध करती है और 0.2 संस्करण के लिए कार्य जुटा रही है, जिसकी अंतिम तिथि 5 अक्टूबर है।

यह क्यों मायने रखता हैयह दावा कि एआई विज्ञान को तेज़ करने वाला है, आमतौर पर परीक्षा-नुमा बेंचमार्कों से टिकाया जाता है — ऐसे सवाल जिनका उत्तर पहले से पता है, उस किस्म के जिनसे किसी वैज्ञानिक की परीक्षा बरसों पहले बंद हो चुकी। यह दूसरी चीज़ नापता है: क्या सिस्टम पाइपलाइन चला सकता है, फ़ाइल फ़ॉर्मैट संभाल सकता है, यह भांप सकता है कि कोई चरण विफल हुआ, और ऐसा परिणाम दे सकता है जिसे कोई शोधकर्ता स्वीकार करे। तीस प्रतिशत एक असली आंकड़ा है जिस पर सुधार किया जा सकता है, संतृप्त नहीं; और चूंकि कार्य नामित योगदानकर्ताओं और निश्चित क्षेत्रों से आते हैं, इसलिए विफलताएं किसी दिशा में इशारा करती हैं — आप देख सकते हैं कि एजेंट किन विज्ञानों में सबसे कमज़ोर हैं, न कि सिर्फ़ यह जान सकते हैं कि वे कमज़ोर हैं।
#AI एजेंट#विज्ञान और अनुसंधान

✓ सत्यापित · 4 स्रोत

WhatsApp X Telegram
ऐप में पढ़ें — मुफ़्त, 9 भाषाएँ

संबंधित खबरें

स्लैक का डिफ़ॉल्ट मॉडल अब क्लॉड है, और सेल्सफोर्स का बिक्री-काम 37 स्किल्स में पैक कर दिया गया है जिन्हें आप चैटबॉट के भीतर से चलाते हैं
2026-08-29
एंथ्रोपिक ने क्लॉड को अपनी ही दस अलाइनमेंट खामियों पर लगा दिया। धोखे वाले काम में उसने 85 अंक पाए, जहाँ 28 मानव सुरक्षा शोधकर्ताओं ने 20 पाए थे।
2026-08-29
Z.ai ने वादे वाले दिन ही GLM-5.3 के वेट्स खोल दिए — पर पिछले तीन मॉडलों में इस्तेमाल किया गया MIT लाइसेंस चुपचाप छोड़ दिया
2026-08-29
रैनसमवेयर गिरोह की तरकीब एक वाक्य थी — कोडिंग एजेंट से कहो कि यह एक टेस्ट है। इसके बाद वह छह हफ़्ते असली कंपनियों के नेटवर्क के भीतर रहा।
2026-08-28
गूगल सर्च अब आपके लिए हवाई किराए पर नज़र रखेगा और होटल भी बुक करेगा — बातचीत लिंक की सूची पर नहीं, बुकिंग पर ख़त्म होती है
2026-08-28