अनुसंधान
AI Minute Newsroom
2026-08-25
स्टैनफ़ोर्ड की एक प्रयोगशाला ने 535 अरब पैरामीटर वाला तीन महीने का प्रशिक्षण सबके सामने शुरू किया — लॉस कर्व, डेटा मिश्रण और नाकाम प्रयोग सहित
पर्सी लियांग की Marin परियोजना ने Marin 535B-A23B का प्रीट्रेनिंग शुरू किया है — यह मिश्रित-विशेषज्ञ मॉडल है जिसमें कुल 535 अरब पैरामीटर हैं और प्रति टोकन 23 अरब सक्रिय रहते हैं — और यह 11 GB200 NVL72 रैक पर चल रहा है। प्रकाशित योजना है: 18.75 ट्रिलियन टोकन, जिसमें 80 प्रतिशत प्रीट्रेनिंग और 20 प्रतिशत मिडट्रेनिंग, लगभग तीन महीने और करीब 2.7e24 FLOPs, इसके बाद पोस्ट-ट्रेनिंग। सामान्य रिलीज़ से इसका फ़र्क़ यह है कि प्रक्रिया स्वयं खुली है: सजीव लॉस कर्व, डेटा मिश्रण, हार्डवेयर टेलीमेट्री, कॉन्फ़िगरेशन, इंजीनियरिंग सामग्री और वे प्रयोग भी जो नाकाम रहे; बाहरी लोग GitHub के ज़रिए प्रयोग सुझा और चला भी सकते हैं। शुरू करने से पहले टीम ने नुस्ख़ा तय करने के लिए छोटे मॉडलों की एक सीढ़ी प्रशिक्षित की।
यह क्यों मायने रखता हैबड़े मॉडल के प्रशिक्षण के बारे में जनता जो कुछ जानती है, वह लगभग पूरा तैयार वेट और बाद में लिखे शोधपत्र से आता है। कौन-सा निर्णय क्यों लिया गया, कौन-सी राह बंद निकली, और किन घंटों में प्रशिक्षण डगमगाया — यही वह हिस्सा है जो प्रयोगशालाएँ प्रकाशित नहीं करतीं, और असली कारीगरी वहीं है। 2.7e24 FLOPs के पैमाने पर एक रन का खुले में चलना पहला मौक़ा है जब फ़्रंटियर लैब के बाहर के लोग ये फ़ैसले होते हुए देख सकते हैं — और पैमाना सीमा के इतना क़रीब है कि सीखा हुआ आगे काम आएगा।
✓ सत्यापित · 3 स्रोत
ऐप में पढ़ें — मुफ़्त, 9 भाषाएँ
संबंधित खबरें
उबाऊ हिस्सा मॉडल को सौंपते ही राज्य-संबद्ध हैकिंग टीमों ने अपने हमलों की संख्या दोगुने से ज़्यादा कर दी
2026-08-251948 से गणितज्ञ जिस सवाल का जवाब नहीं दे पाए थे, रविवार को X पर डाली गई 108 पन्नों की फ़ाइल ने उसका जवाब दे दिया
2026-08-25पिछले साल के अंत तक दस में से नौ जैवचिकित्सा शोधपत्रों पर किसी भाषा मॉडल की उँगलियों के निशान थे
2026-08-24लगभग 90 प्रतिशत अधिकारी कहते हैं कि एआई से उत्पादकता नहीं बढ़ी। छंटनी फिर भी हो रही है।
2026-08-24एक पुराने Claude ने 10 में से 10 बार Anthropic का अपना ही कंटेंट नियम तोड़ा — और वह अब भी Azure तथा Bedrock पर बिक रहा है
2026-08-23