Nvidia hat am 11. August Nemotron 3.5 Lightning veröffentlicht: ein Mixture-of-Experts-Modell mit 30 Milliarden Parametern, von denen pro Token nur 3 Milliarden aktiviert werden, mit einem Kontextfenster von bis zu einer Million Token und Gewichten unter der freizügigen Lizenz OpenMDW-1.1 — Unternehmen dürfen es herunterladen, verändern und darauf aufbauen, ohne Nvidia zu fragen. Gedacht ist es für die unglamouröse Hälfte der Agentenarbeit: Code-Review, Werkzeugaufrufe, Überwachung von Sicherheitswarnungen, Beantwortung von Abrechnungsfragen — also die Schritte, die ein Frontier-Modell zwar plant, aber nicht selbst ausführen muss. Nvidia beansprucht bis zur vierfachen Ausgabegeschwindigkeit und 30 % schnellere Erledigung agentischer Aufgaben gegenüber Modellen vergleichbarer Größe und nennt 81,62 auf MMLU Pro, 75,57 auf GPQA Diamond und 52,80 auf SWE-bench Verified. Es läuft lokal auf RTX-PCs, DGX Spark, DGX Station und Jetson-Boards, skaliert aber auch ins Rechenzentrum, und ist über Hugging Face, ModelScope und OpenRouter verfügbar. Zusätzlich hat Nvidia NeMo Switchyard quelloffen gemacht, eine Routing-Bibliothek, die jeden Schritt eines Arbeitsablaufs an das günstigste Modell schickt, das ihn bewältigen kann; nach Nvidias eigenen Messungen kostet ein über Switchyard geroutetes Setup knapp ein Drittel dessen, was es kostet, alles mit Opus 4.8 zu erledigen.