एनवीडिया ने 11 अगस्त को Nemotron 3.5 Lightning जारी किया: 30 अरब पैरामीटर वाला मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) मॉडल जो प्रति टोकन केवल 3 अरब पैरामीटर सक्रिय करता है, जिसका कॉन्टेक्स्ट विंडो 10 लाख टोकन तक जाता है और जिसके वेट उदार OpenMDW-1.1 लाइसेंस के तहत हैं — कंपनियाँ इसे एनवीडिया से पूछे बिना डाउनलोड, संशोधित और इस पर निर्माण कर सकती हैं। यह एजेंट के काम के उस बिना चमक वाले आधे हिस्से के लिए बना है: कोड समीक्षा, टूल कॉल, सुरक्षा अलर्ट पर नज़र, बिलिंग सवालों के जवाब — यानी वे चरण जिनकी योजना एक फ्रंटियर मॉडल बनाएगा पर जिन्हें खुद करने की ज़रूरत नहीं। एनवीडिया का दावा है कि समान आकार के मॉडलों की तुलना में आउटपुट गति चार गुना तक और एजेंटिक कार्य पूरा करने में 30% तेज़ है; रिपोर्ट किए गए स्कोर हैं MMLU Pro पर 81.62, GPQA Diamond पर 75.57 और SWE-bench Verified पर 52.80। यह RTX पीसी, DGX Spark, DGX Station और Jetson बोर्ड पर स्थानीय रूप से चलता है और डेटा सेंटर तक स्केल करता है; Hugging Face, ModelScope और OpenRouter पर उपलब्ध है। साथ ही एनवीडिया ने NeMo Switchyard को भी ओपन-सोर्स किया — एक राउटिंग लाइब्रेरी जो वर्कफ़्लो के हर चरण को उस सबसे सस्ते मॉडल के पास भेजती है जो उसे संभाल सके। एनवीडिया के अपने बेंचमार्क के अनुसार, Switchyard से रूट किया गया सेटअप सब कुछ Opus 4.8 से कराने की तुलना में लगभग एक-तिहाई लागत पर आता है।