अनुसंधान
AI Minute Newsroom
2026-08-22
मॉडल अकेले 30 प्रतिशत पर था। एनवीडिया के ढाँचे में लपेटने पर उसी मॉडल ने सब कुछ पार कर लिया।
एनवीडिया ने 21 अगस्त को AVO यानी एजेंटिक वेरिएशन ऑपरेटर्स के नतीजे प्रकाशित किए। यह सामान्य प्रयोजन का कोडिंग एजेंट तंत्र इंटरैक्टिव रीजनिंग बेंचमार्क ARC-AGI-3 के सार्वजनिक सेट में सभी 25 वातावरणों के सभी 183 स्तर पूरे कर गया और मानव-सापेक्ष क्रिया दक्षता के पैमाने पर 100.00 अंक पाए। ये वातावरण एजेंट को न कोई निर्देश देते हैं, न नियम, न लक्ष्य; उसे खेलते हुए ही समझना पड़ता है कि खेल क्या है। सोचने का काम Anthropic के Claude Opus 5 ने किया, जो अकेले और उच्च तर्क प्रयास पर चलाए जाने पर इसी सेट में लगभग 30 प्रतिशत तक ही पहुँचता है। AVO को 6,624 क्रियाएँ लगीं, पिछले सर्वश्रेष्ठ VISTA से लगभग 12 प्रतिशत कम। एनवीडिया ने बताया कि यह नतीजा केवल 25 वातावरणों वाले सार्वजनिक सेट का है, अर्ध-निजी या निजी प्रतियोगिता सेट का नहीं।
यह क्यों मायने रखता हैदो साल से मान्यता यही थी कि प्रगति अगले मॉडल के साथ आएगी। यह नतीजा कहता है कि उसका बड़ा हिस्सा अब उस सॉफ़्टवेयर से मिल सकता है जो आप पहले से खरीद सकने वाले मॉडल के इर्द-गिर्द लपेटते हैं: स्मृति, योजना, निगरानी और एक ऐसा चक्र जो अपने ही काम को जाँचकर दोबारा कोशिश करता है। वही वज़न बिना दोबारा प्रशिक्षण के बेंचमार्क के एक तिहाई से पूरे तक पहुँच गए। इससे तय होता है कि इंजीनियरिंग मेहनत कहाँ लगे, और यह सवाल कि कोई उत्पाद किस मॉडल पर चलता है, उसकी असली क्षमता का बहुत कमज़ोर संकेत बन जाता है।
✓ सत्यापित · 3 स्रोत
▶ संबंधित वीडियो: Interactive Reasoning Benchmarks | ARC-AGI-3 Preview
ऐप में पढ़ें — मुफ़्त, 9 भाषाएँ
संबंधित खबरें
एक मॉडल उस तरीके के बिना सीखा जिससे हर AI सीखता है।
2026-10-06TikTok ने देखे जा रहे वीडियो के अंदर शॉपिंग बॉट रख दिया।
2026-10-06Reflection 501 अरब पैरामीटर वाला मॉडल मुफ्त में देगा।
2026-10-06विकिमीडिया को मई की गड़बड़ी में OpenAI एजेंट पर शक है।
2026-10-06मेटा का सहायक आपके हर परिचित की घंटेवार फ़ाइल रखता है।
2026-10-05