अनुसंधान
2026-08-21
एआई को प्रशिक्षित करने का तरीका सुधारने के लिए चार घंटे और एक जीपीयू दिया गया: सर्वश्रेष्ठ एजेंट को 1 में से 0.25 मिले — और अधिकांश ने कोशिश ही नहीं की
20 अगस्त को arXiv पर डाला गया बेंचमार्क AI4AI-Bench सामान्य कोडिंग मूल्यांकनों से अधिक संकीर्ण और अधिक दिलचस्प सवाल परखता है: क्या कोई एआई एजेंट उन एल्गोरिद्म को सुधार सकता है जिनसे एआई को प्रशिक्षित किया जाता है? व्यवस्था में दस फ्रीज़ की गई शोध रिपॉज़िटरी हैं जो प्रशिक्षण एल्गोरिद्म के दस परिवारों को कवर करती हैं। एजेंट को एक B300 जीपीयू पर चार घंटे मिलते हैं ताकि वह प्रशिक्षण कोड बदल सके; फिर परिणाम को अधिकतम बारह घंटे चलाया जाता है और छिपे बेंचमार्क पर अंक दिए जाते हैं, जहाँ 0 का अर्थ है बेकार मॉडल, 0.1 का अर्थ है मूल अपरिवर्तित एल्गोरिद्म और 1.0 का अर्थ है ज्ञात सर्वोत्तम परिणाम। छह प्रणालियों के 29 विन्यासों में, दसों कार्यों पर, औसत अंक 0.166 रहा और सर्वश्रेष्ठ एकल प्रणाली 0.250 तक पहुँची। सबसे खुलासा करने वाला आँकड़ा क्षमता के बारे में है ही नहीं। जिन प्रणालियों ने वास्तव में एल्गोरिद्म बदलने की कोशिश की उनका औसत 0.226 रहा, जबकि जिन्होंने नहीं की उनका 0.126 — और तर्क-प्रयास बढ़ाने पर बदलाव आज़माने वाले रन 8 प्रतिशत से बढ़कर 64 प्रतिशत हो गए, और औसत 0.094 से 0.196 पर पहुँच गया। यह पेपर प्रीप्रिंट है और सहकर्मी समीक्षा से नहीं गुज़रा है।
यह क्यों मायने रखता हैपुनरावर्ती आत्म-सुधार — एआई जो एआई को बेहतर बनाता जाए और यह चक्रवृद्धि हो — तेज़ उड़ान वाले अधिकांश तर्कों के पीछे की क्रियाविधि है, और अब तक यह ज़्यादातर अमूर्त रूप में ही तर्कित होती रही है। यह उस पर संख्या रखने की पहली गंभीर कोशिशों में से एक है, और संख्या छोटी है: सर्वश्रेष्ठ प्रणाली उस परिणाम के एक-चौथाई तक पहुँची जो साहित्य में पहले से मौजूद है। पर याद रखने लायक हिस्सा विफलता का ढंग है। एजेंट मुख्यतः विज्ञान में असफल नहीं हो रहे थे; उनमें से अधिकांश विज्ञान की कोशिश ही नहीं कर रहे थे, बल्कि सुरक्षित छेड़छाड़ पर लौट रहे थे — और उन्हें बस अधिक देर सोचने देने से यह अनुपात आठ गुना बदल गया। यह बुद्धि की नहीं, आदत की सीमा है, और आदतें ठीक वही चीज़ हैं जिन्हें अभियांत्रिकी जल्दी हटा देती है।
✓ सत्यापित · 2 स्रोत
ऐप में पढ़ें — मुफ़्त, 9 भाषाएँ
संबंधित खबरें
मशीन लर्निंग ने बीमार मस्तिष्क कोशिकाओं का आकार पढ़ा और नौ पहले से स्वीकृत दवाएँ चुनीं जिन्होंने उन्हें शांत किया
2026-08-21अफवाह: जिस गुमनाम मॉडल ने मुफ्त में कोडिंग बेंचमार्क में शीर्ष स्थान लिया, वह कथित तौर पर झिपू का अघोषित फ्लैगशिप है
2026-08-21डीपसीक का सस्ता वर्कहॉर्स अब देख सकता है — और आँखों वाली एजेंट कार्यों में वह एंथ्रोपिक के सर्वश्रेष्ठ के करीब होने का दावा करता है
2026-08-21एनवीडिया प्रतिद्वंद्वी की "मॉडल बनाने वाली मशीन" के लिए 6 अरब डॉलर दे रहा है — और उसे चलाने वाले 109 लोगों को नौकरी दे रहा है
2026-08-21ChatGPT अब आपके iMessage पढ़ सकता है और भेज भी सकता है — और जो सेटिंग उसे पूछने से छूट देती है, वही है जिसके बारे में OpenAI चेतावनी देता है
2026-08-21