अनुसंधान
AI Minute Newsroom
2026-08-29
शोधकर्ताओं ने अपनी प्रयोगशाला के 70 असली काम परीक्षा के रूप में सौंप दिए। सबसे अच्छे एआई एजेंट ने उसका 30 प्रतिशत पूरा किया।
टर्मिनल-बेंच-साइंस 0.1, जिसे इस हफ़्ते स्टैनफोर्ड के शोधकर्ताओं ने टर्मिनल-बेंच और हार्बर टीमों के साथ जारी किया, एक ऐसा बेंचमार्क है जो उस काम से बना है जो वैज्ञानिक सचमुच करते हैं। इसके 70 कार्यों में से हर एक किसी शोधकर्ता ने दिया, जिसने अपनी ही प्रयोगशाला के एक कम्प्यूटेशनल वर्कफ़्लो को ऐसा रूप दिया जिसे कोई एजेंट टर्मिनल में आज़मा सके — जीव, भौतिक, पृथ्वी, गणितीय और अभियांत्रिकी विज्ञानों में। हर कार्य एक कंटेनर में चलता है और प्रोग्राम द्वारा जांचा जाता है, यानी अंक इस बात के हैं कि काम सही निकला या नहीं, न कि इस बात के कि एजेंट ने क्या दावा किया। नतीजे जान-बूझकर कम हैं: क्लॉड ओपस 5 सबसे आगे है, 30.0 प्रतिशत समाधान दर के साथ; जीपीटी-5.6 सोल को 22.4 प्रतिशत और क्लॉड फेबल 5 को 21.4 प्रतिशत मिला। हर मॉडल ने सामान्य टर्मिनल-बेंच 3.0 की तुलना में दस अंक से ज़्यादा कम स्कोर किया। परियोजना 22 देशों के 376 योगदानकर्ता सूचीबद्ध करती है और 0.2 संस्करण के लिए कार्य जुटा रही है, जिसकी अंतिम तिथि 5 अक्टूबर है।
यह क्यों मायने रखता हैयह दावा कि एआई विज्ञान को तेज़ करने वाला है, आमतौर पर परीक्षा-नुमा बेंचमार्कों से टिकाया जाता है — ऐसे सवाल जिनका उत्तर पहले से पता है, उस किस्म के जिनसे किसी वैज्ञानिक की परीक्षा बरसों पहले बंद हो चुकी। यह दूसरी चीज़ नापता है: क्या सिस्टम पाइपलाइन चला सकता है, फ़ाइल फ़ॉर्मैट संभाल सकता है, यह भांप सकता है कि कोई चरण विफल हुआ, और ऐसा परिणाम दे सकता है जिसे कोई शोधकर्ता स्वीकार करे। तीस प्रतिशत एक असली आंकड़ा है जिस पर सुधार किया जा सकता है, संतृप्त नहीं; और चूंकि कार्य नामित योगदानकर्ताओं और निश्चित क्षेत्रों से आते हैं, इसलिए विफलताएं किसी दिशा में इशारा करती हैं — आप देख सकते हैं कि एजेंट किन विज्ञानों में सबसे कमज़ोर हैं, न कि सिर्फ़ यह जान सकते हैं कि वे कमज़ोर हैं।
✓ सत्यापित · 4 स्रोत
ऐप में पढ़ें — मुफ़्त, 9 भाषाएँ
संबंधित खबरें
स्लैक का डिफ़ॉल्ट मॉडल अब क्लॉड है, और सेल्सफोर्स का बिक्री-काम 37 स्किल्स में पैक कर दिया गया है जिन्हें आप चैटबॉट के भीतर से चलाते हैं
2026-08-29एंथ्रोपिक ने क्लॉड को अपनी ही दस अलाइनमेंट खामियों पर लगा दिया। धोखे वाले काम में उसने 85 अंक पाए, जहाँ 28 मानव सुरक्षा शोधकर्ताओं ने 20 पाए थे।
2026-08-29Z.ai ने वादे वाले दिन ही GLM-5.3 के वेट्स खोल दिए — पर पिछले तीन मॉडलों में इस्तेमाल किया गया MIT लाइसेंस चुपचाप छोड़ दिया
2026-08-29रैनसमवेयर गिरोह की तरकीब एक वाक्य थी — कोडिंग एजेंट से कहो कि यह एक टेस्ट है। इसके बाद वह छह हफ़्ते असली कंपनियों के नेटवर्क के भीतर रहा।
2026-08-28गूगल सर्च अब आपके लिए हवाई किराए पर नज़र रखेगा और होटल भी बुक करेगा — बातचीत लिंक की सूची पर नहीं, बुकिंग पर ख़त्म होती है
2026-08-28