aiminute. ← सभी AI समाचार
अनुसंधान 2026-08-22

किसी अप्रकाशित शोधपत्र की संदर्भ-सूची मॉडल को दें और पूछें कि पत्र क्या कहता है। सबसे अच्छे मॉडल 15 प्रतिशत बार सही होते हैं।

किसी अप्रकाशित शोधपत्र की संदर्भ-सूची मॉडल को दें और पूछें कि पत्र क्या कहता है। सबसे अच्छे मॉडल 15 प्रतिशत बार सही होते हैं।

Qingqing Mao और सहयोगियों द्वारा 17 अगस्त को arXiv पर रखा गया Reconstruction नामक बेंचमार्क सामान्य तर्क-मूल्यांकनों से अधिक संकीर्ण और कठिन चीज़ जाँचता है: क्या कोई मॉडल केवल प्रकाशन-पूर्व संदर्भ-सूची से किसी शोधपत्र का केंद्रीय विचार निकाल सकता है? मूल शोधपत्र को, उसी समय या बाद में प्रकाशित हर चीज़ के साथ, छिपा दिया जाता है, संदर्भों के शीर्षक हटाकर गुमनाम आईडी दी जाती हैं, और एक अलग भाषा मॉडल तय करता है कि प्रस्तावित परिकल्पना असली से मेल खाती है या नहीं। छह वैज्ञानिक क्षेत्रों के 643 शोधपत्रों पर सात अग्रणी मॉडल छिपाए गए विचार से लगभग 3 से 15 प्रतिशत बार ही मेल खा सके। फिर लेखकों ने उन्हीं मॉडलों को एक पाइपलाइन में जोड़ा जहाँ वे एक-दूसरे की परिकल्पनाओं की समीक्षा करते हैं और प्रतिस्पर्धी स्लॉट पर स्विस-प्रणाली टूर्नामेंट चलता है; इससे मेल दर बढ़कर लगभग 23 से 42 प्रतिशत हो गई, यानी सर्वश्रेष्ठ एकल मॉडल की करीब 2.4 गुना।

यह क्यों मायने रखता हैसाहित्य से जुड़े किसी काम में मॉडल के अच्छे प्रदर्शन की दो व्याख्याएँ संभव हैं: उसने क्षेत्र को समझा, या वह उत्तर पहले ही पढ़ चुका है। यह बेंचमार्क खास तौर पर दूसरी व्याख्या को हटाने के लिए बना है, और जो बचता है वह छोटा है। यही अंतर एक उत्कृष्ट शोध-सहायक और एक शोधकर्ता के बीच का फ़र्क है, और जब प्रयोगशालाएँ अपनी प्रणालियों को वैज्ञानिक कहती हैं तब इसे याद रखना ज़रूरी है। हालाँकि नतीजे का दूसरा हिस्सा अधिक उपयोगी है। वही वेट, जब आपस में बहस करने की तरह व्यवस्थित किए गए, तो अंक दोगुने से अधिक हो गए। इस हफ्ते यह दूसरी बार है जब मुख्य आँकड़ा मॉडल से नहीं, उसके चारों ओर बनी संरचना से आया।
#AI एजेंट#विज्ञान और अनुसंधान

✓ सत्यापित · 2 स्रोत

WhatsApp X Telegram
ऐप में पढ़ें — मुफ़्त, 9 भाषाएँ

संबंधित खबरें

गूगल के खुले मॉडल एक अरब बार डाउनलोड हुए, और बाहरी लोगों ने उनके 1,00,000 संस्करण बना डाले
2026-08-22
तीन-चौथाई अमेरिकी अपने पास डेटा सेंटर नहीं चाहते। एक साल पहले वे बराबरी पर बँटे थे।
2026-08-22
मॉडल अकेले 30 प्रतिशत पर था। एनवीडिया के ढाँचे में लपेटने पर उसी मॉडल ने सब कुछ पार कर लिया।
2026-08-22
मशीन लर्निंग ने बीमार मस्तिष्क कोशिकाओं का आकार पढ़ा और नौ पहले से स्वीकृत दवाएँ चुनीं जिन्होंने उन्हें शांत किया
2026-08-21
डीपसीक का सस्ता वर्कहॉर्स अब देख सकता है — और आँखों वाली एजेंट कार्यों में वह एंथ्रोपिक के सर्वश्रेष्ठ के करीब होने का दावा करता है
2026-08-21