अनुसंधान
AI Minute Newsroom
2026-08-15
कोड लिखो और साथ ही उसे सही सिद्ध भी करो — सबसे बेहतर एजेंट ने 43 में से 27 किए, और कठिन वालों में शून्य
डॉन सॉन्ग सहित एक टीम ने 13 अगस्त को arXiv पर Vero प्रकाशित किया, जिसे रिपॉज़िटरी-स्तर पर सत्यापित कोड संश्लेषण का पहला बेंचमार्क बताया गया है। Vero किसी एजेंट से टेस्ट पास करने वाला फ़ंक्शन नहीं मांगता, बल्कि बहु-मॉड्यूल कोडबेस में चलने लायक कार्यान्वयन और साथ ही एक मशीन-जांच योग्य प्रमाण मांगता है कि वह कार्यान्वयन औपचारिक विनिर्देश से मेल खाता है। इसमें वास्तविक रिपॉज़िटरी से बनी 43 समस्याएं हैं, जो Lean 4, Dafny, Verus और Coq जैसी प्रमाण एवं प्रोग्रामिंग भाषाओं तथा क्रिप्टोग्राफिक प्रोटोकॉल से लेकर वितरित प्रणालियों तक के क्षेत्रों को समेटती हैं। लेखकों द्वारा परखे गए सबसे मजबूत एजेंट विन्यास ने 43 में से 27 पूरी तरह हल किए, और सबसे कठिन रिपॉज़िटरी पर एक भी विनिर्देश बंद नहीं कर सका।
यह क्यों मायने रखता हैएजेंटों के सॉफ़्टवेयर लिखने के बारे में आप जो भी दावा पढ़ते हैं, वह लगभग हमेशा टेस्ट पास होने पर टिका होता है; और टेस्ट केवल उन्हीं स्थितियों को ढकते हैं जिन्हें किसी ने लिखने की सोची। मशीन द्वारा जांचा गया प्रमाण एकमात्र ऐसा साक्ष्य है जिसे इससे फर्क नहीं पड़ता कि मॉडल कितना चतुर लगा — प्रमाण या तो संकलित होता है या नहीं। यह पहली बार है कि किसी ने पूरे रिपॉज़िटरी के पैमाने पर इस कसौटी पर एजेंटों को मापा, और उत्तर है: आसान दो-तिहाई पार कर लेते हैं, कठिन एक-तिहाई को छूते तक नहीं। अगली बार जब किसी कोडिंग एजेंट को 'भरोसेमंद' कहा जाए, यह संख्या याद रखने लायक है।
✓ सत्यापित · 1 स्रोत
ऐप में पढ़ें — मुफ़्त, 9 भाषाएँ
संबंधित खबरें
एक मॉडल उस तरीके के बिना सीखा जिससे हर AI सीखता है।
2026-10-06TikTok ने देखे जा रहे वीडियो के अंदर शॉपिंग बॉट रख दिया।
2026-10-06Reflection 501 अरब पैरामीटर वाला मॉडल मुफ्त में देगा।
2026-10-06विकिमीडिया को मई की गड़बड़ी में OpenAI एजेंट पर शक है।
2026-10-06मेटा का सहायक आपके हर परिचित की घंटेवार फ़ाइल रखता है।
2026-10-05