नए मॉडल
2026-08-02
AMD का Instella-MoE: पूरी ट्रेनिंग रेसिपी के साथ आने वाला ओपन मॉडल
AMD ने Instella-MoE-16B-A3B जारी किया — 16 अरब कुल पैरामीटर वाला मिक्सचर-ऑफ-एक्सपर्ट्स मॉडल, जो प्रति टोकन केवल 2.8 अरब पैरामीटर सक्रिय करता है और पूरी तरह AMD के अपने Instinct MI300X और MI325X GPU पर प्रशिक्षित हुआ है। असामान्य रूप से, इस रिलीज़ में हर ट्रेनिंग चरण के चेकपॉइंट, डेटा मिश्रण, ट्रेनिंग कॉन्फ़िग और कोड शामिल हैं — कोड MIT लाइसेंस में, वेट्स केवल शोध-लाइसेंस में। AMD का कहना है कि बेस मॉडल पूर्ण-ओपन मॉडलों में सबसे ऊँचा औसत स्कोर रखता है, Moonlight-16B और OLMo-3 से आगे।
यह क्यों मायने रखता हैअधिकांश 'ओपन' मॉडल सिर्फ वेट्स जारी करते हैं। पूरी ट्रेनिंग रेसिपी वाली रिलीज़ शोधकर्ताओं को यह वास्तव में समझने और दोहराने देती है कि मॉडल कैसे बनता है — और यह प्रमाण है कि प्रतिस्पर्धी ट्रेनिंग Nvidia हार्डवेयर के बिना भी संभव है।
✓ सत्यापित · 3 स्रोत
▶ संबंधित वीडियो: AMD Releases First Ever AI model: Instella-MoE-16B-A3B-Think
ऐप में पढ़ें — मुफ़्त, 9 भाषाएँ
संबंधित खबरें
डीपसीक का सस्ता वर्कहॉर्स अब देख सकता है — और आँखों वाली एजेंट कार्यों में वह एंथ्रोपिक के सर्वश्रेष्ठ के करीब होने का दावा करता है
2026-08-21रोबोट को एक बार दिखाइए — तीन से बारह सेकंड — और वह बिना किसी प्रशिक्षण के सौ में से 59 बार काम सही कर देता है
2026-08-21मॉडल खुद अपने काम गढ़ता है, उन्हें परखने का ढाँचा भी खुद बनाता है, फिर नतीजों पर खुद को प्रशिक्षित करता है — और DeepReinforce ने वज़न मुफ़्त दे दिए
2026-08-20एक ग्राफ़िक्स कार्ड में समा जाने वाला मुफ़्त मॉडल 52 अंक लाता है — फिर एक तस्वीर बनाने में 22,276 सोच-टोकन ख़र्च करता है
2026-08-18झिपू ने नया मॉडल नहीं बनाया। पुराने को ही प्रशिक्षित करती रही — और कहती है कोडिंग 50 प्रतिशत बेहतर हो गई
2026-08-17