aiminute. ← सभी AI समाचार
अनुसंधान AI Minute Newsroom 2026-08-22

मॉडल अकेले 30 प्रतिशत पर था। एनवीडिया के ढाँचे में लपेटने पर उसी मॉडल ने सब कुछ पार कर लिया।

मॉडल अकेले 30 प्रतिशत पर था। एनवीडिया के ढाँचे में लपेटने पर उसी मॉडल ने सब कुछ पार कर लिया।

एनवीडिया ने 21 अगस्त को AVO यानी एजेंटिक वेरिएशन ऑपरेटर्स के नतीजे प्रकाशित किए। यह सामान्य प्रयोजन का कोडिंग एजेंट तंत्र इंटरैक्टिव रीजनिंग बेंचमार्क ARC-AGI-3 के सार्वजनिक सेट में सभी 25 वातावरणों के सभी 183 स्तर पूरे कर गया और मानव-सापेक्ष क्रिया दक्षता के पैमाने पर 100.00 अंक पाए। ये वातावरण एजेंट को न कोई निर्देश देते हैं, न नियम, न लक्ष्य; उसे खेलते हुए ही समझना पड़ता है कि खेल क्या है। सोचने का काम Anthropic के Claude Opus 5 ने किया, जो अकेले और उच्च तर्क प्रयास पर चलाए जाने पर इसी सेट में लगभग 30 प्रतिशत तक ही पहुँचता है। AVO को 6,624 क्रियाएँ लगीं, पिछले सर्वश्रेष्ठ VISTA से लगभग 12 प्रतिशत कम। एनवीडिया ने बताया कि यह नतीजा केवल 25 वातावरणों वाले सार्वजनिक सेट का है, अर्ध-निजी या निजी प्रतियोगिता सेट का नहीं।

यह क्यों मायने रखता हैदो साल से मान्यता यही थी कि प्रगति अगले मॉडल के साथ आएगी। यह नतीजा कहता है कि उसका बड़ा हिस्सा अब उस सॉफ़्टवेयर से मिल सकता है जो आप पहले से खरीद सकने वाले मॉडल के इर्द-गिर्द लपेटते हैं: स्मृति, योजना, निगरानी और एक ऐसा चक्र जो अपने ही काम को जाँचकर दोबारा कोशिश करता है। वही वज़न बिना दोबारा प्रशिक्षण के बेंचमार्क के एक तिहाई से पूरे तक पहुँच गए। इससे तय होता है कि इंजीनियरिंग मेहनत कहाँ लगे, और यह सवाल कि कोई उत्पाद किस मॉडल पर चलता है, उसकी असली क्षमता का बहुत कमज़ोर संकेत बन जाता है।
#कोडिंग#AI एजेंट

✓ सत्यापित · 3 स्रोत

▶ संबंधित वीडियो: Interactive Reasoning Benchmarks | ARC-AGI-3 Preview
WhatsApp X Telegram
ऐप में पढ़ें — मुफ़्त, 9 भाषाएँ

संबंधित खबरें

एक मॉडल उस तरीके के बिना सीखा जिससे हर AI सीखता है।
2026-10-06
TikTok ने देखे जा रहे वीडियो के अंदर शॉपिंग बॉट रख दिया।
2026-10-06
Reflection 501 अरब पैरामीटर वाला मॉडल मुफ्त में देगा।
2026-10-06
विकिमीडिया को मई की गड़बड़ी में OpenAI एजेंट पर शक है।
2026-10-06
मेटा का सहायक आपके हर परिचित की घंटेवार फ़ाइल रखता है।
2026-10-05