नए मॉडल
2026-08-20
मॉडल खुद अपने काम गढ़ता है, उन्हें परखने का ढाँचा भी खुद बनाता है, फिर नतीजों पर खुद को प्रशिक्षित करता है — और DeepReinforce ने वज़न मुफ़्त दे दिए
DeepReinforce ने 19 अगस्त को Ornith-1.5 तीन खुले-वज़न आकारों में जारी किया: 397 अरब पैरामीटर वाला मिक्सचर-ऑफ़-एक्सपर्ट्स, 35 अरब वाला मॉडल जो प्रति टोकन 3 अरब पैरामीटर सक्रिय करता है, और 9 अरब का सघन मॉडल — सभी MIT लाइसेंस के तहत, वज़न Hugging Face पर। दिलचस्प बात आकार नहीं है। इंसानों के लिखे तयशुदा कामों से सीखने के बजाय मॉडल खुद काम प्रस्तावित करता है, हर एक को वैधता, कठिनाई और नयेपन पर अंक देता है, उसे चलाने का ढाँचा खुद लिखता है, और फिर बनाए गए हल के प्रयास वापस रीइन्फ़ोर्समेंट लर्निंग में जाते हैं। टीम इसे स्व-ढाँचे से स्व-सुधार तक का चक्र पूरा करना कहती है। प्रयोगशाला के अपने आँकड़ों के अनुसार 397B मॉडल Terminal-Bench 2.1 पर 86.1 और DeepSWE पर 56.0 पाता है, जबकि Claude Opus 4.8 इन्हीं पर 85.0 और 59.0 और GLM-5.2 82.7 और 46.2 है; GPQA Diamond पर 92.8 बताया गया है। संदर्भ खिड़की 262,144 टोकन की है और BF16 में पूरा मॉडल लगभग 800 गीगाबाइट का, यानी यहाँ खुला होने का मतलब आपके लैपटॉप पर चलना नहीं है। वह काम 9B संस्करण करता है, जो Terminal-Bench 2.1 पर 47.0 और SWE-bench Verified पर 70.6 पाता है।
यह क्यों मायने रखता हैअब हर प्रयोगशाला कहती है कि अच्छे प्रशिक्षण-प्रश्नों की आपूर्ति घट रही है। यह उसका एक उत्तर है: पाठ्यक्रम मॉडल को ही लिखने दो। अगर यह टिकता है, तो क्षमता की छत यह नहीं रहेगी कि इंसान कितने ढंग के प्रश्न लिख सकते हैं, बल्कि यह होगी कि मॉडल अपने ही गढ़े प्रश्न की सार्थकता कितनी अच्छी तरह आँक पाता है — और यह ज़्यादा असहज अड़चन है, क्योंकि अपनी कठिनाई खुद जाँचने वाली प्रणाली ऐसे प्रश्नों की ओर बह सकती है जो कठिन तो हों पर निरर्थक। यह भी याद रहे कि ये DeepReinforce के अपने चुने बेंचमार्क पर उसके अपने आँकड़े हैं; कोई स्वतंत्र मूल्यांकन अभी नहीं आया। जिस पर विवाद नहीं, वह लाइसेंस है। टर्मिनल-एजेंट काम में किसी प्रमुख मॉडल की बराबरी का दावा करने वाला MIT-लाइसेंस मॉडल सार्वजनिक रूप से फ़र्श ऊँचा कर देता है, और बंद मॉडल तक पहुँच बेचने वाले हर किसी को अब उसी के सामने अपनी कीमत रखनी होगी।
✓ सत्यापित · 4 स्रोत
▶ संबंधित वीडियो: Ornith-1.5 Ships 9B Dense, 35B and 397B MoE Models | Models & Agents #Shorts
ऐप में पढ़ें — मुफ़्त, 9 भाषाएँ
संबंधित खबरें
अफवाह: जिस गुमनाम मॉडल ने मुफ्त में कोडिंग बेंचमार्क में शीर्ष स्थान लिया, वह कथित तौर पर झिपू का अघोषित फ्लैगशिप है
2026-08-21डीपसीक का सस्ता वर्कहॉर्स अब देख सकता है — और आँखों वाली एजेंट कार्यों में वह एंथ्रोपिक के सर्वश्रेष्ठ के करीब होने का दावा करता है
2026-08-21एनवीडिया प्रतिद्वंद्वी की "मॉडल बनाने वाली मशीन" के लिए 6 अरब डॉलर दे रहा है — और उसे चलाने वाले 109 लोगों को नौकरी दे रहा है
2026-08-21एआई को प्रशिक्षित करने का तरीका सुधारने के लिए चार घंटे और एक जीपीयू दिया गया: सर्वश्रेष्ठ एजेंट को 1 में से 0.25 मिले — और अधिकांश ने कोशिश ही नहीं की
2026-08-21ChatGPT अब आपके iMessage पढ़ सकता है और भेज भी सकता है — और जो सेटिंग उसे पूछने से छूट देती है, वही है जिसके बारे में OpenAI चेतावनी देता है
2026-08-21