aiminute. ← Alle KI-News
Forschung AI Minute Newsroom 2026-08-25

Ein Stanford-Labor hat einen dreimonatigen Trainingslauf mit 535 Milliarden Parametern öffentlich begonnen — Verlustkurven, Datenmischung und gescheiterte Experimente inklusive

Ein Stanford-Labor hat einen dreimonatigen Trainingslauf mit 535 Milliarden Parametern öffentlich begonnen — Verlustkurven, Datenmischung und gescheiterte Experimente inklusive

Percy Liangs Marin-Projekt hat das Vortraining von Marin 535B-A23B gestartet, einem Mixture-of-Experts-Modell mit 535 Milliarden Parametern und 23 Milliarden aktiven je Token, auf 11 GB200-NVL72-Racks. Der veröffentlichte Plan: 18,75 Billionen Token, davon 80 Prozent Vortraining und 20 Prozent Zwischentraining, über rund drei Monate und etwa 2,7e24 FLOPs, danach folgt das Nachtraining. Was den Lauf von einer üblichen Veröffentlichung unterscheidet, ist seine Offenheit: Verlustkurven in Echtzeit, die Datenmischung, Hardware-Telemetrie, Konfigurationen, Engineering-Artefakte und auch die Experimente, die nicht funktioniert haben — Außenstehende können über GitHub Versuche vorschlagen und sogar durchführen. Vor dem Start trainierte das Team eine Leiter kleinerer Modelle, um das Rezept festzuzurren.

Warum es wichtig istFast alles, was die Öffentlichkeit über das Training großer Modelle weiß, stammt aus fertigen Gewichten und einem im Nachhinein geschriebenen Papier. Die Abwägungen, die Sackgassen und die Stunden, in denen ein Lauf kippt, sind genau das, was Labore nicht veröffentlichen — und sie machen den größten Teil des Handwerks aus. Ein Lauf mit 2,7e24 FLOPs, der offen abläuft, ist die erste Gelegenheit für Menschen außerhalb eines Frontier-Labors, diese Entscheidungen im Moment ihres Zustandekommens mitzuverfolgen, und zwar in einer Größenordnung nahe genug an der Spitze, dass sich das Gelernte übertragen lässt.

✓ Verifiziert · 3 Quellen

WhatsApp X Telegram
In der App lesen — kostenlos, 9 Sprachen

Verwandte Meldungen

Staatsnahe Hackergruppen haben ihr Angriffsvolumen mehr als verdoppelt, seit sie die langweiligen Teile einem Modell überlassen
2026-08-25
Eine Frage, die Mathematiker seit 1948 nicht beantworten konnten, wurde am Sonntag beantwortet — in einer 108-seitigen Datei auf X
2026-08-25
Ende vergangenen Jahres trugen neun von zehn biomedizinischen Arbeiten die Fingerabdrücke eines Sprachmodells
2026-08-24
Rund 90 Prozent der Führungskräfte sagen, KI habe die Produktivität nicht gesteigert. Gestrichen wird trotzdem.
2026-08-24
Ein älteres Claude verstieß in 10 von 10 Versuchen gegen Anthropics eigene Inhaltsregel — und wird weiterhin über Azure und Bedrock verkauft
2026-08-23