Percy Liang の Marin プロジェクトが、総パラメータ 5350 億・トークンあたり 230 億が活性化する混合エキスパートモデル Marin 535B-A23B の事前学習を、GB200 NVL72 ラック 11 台で開始した。公開された計画は 18.75 兆トークン、うち 80% が事前学習、20% が中間学習で、期間はおよそ 3 か月、計算量は約 2.7e24 FLOPs、その後に事後学習が続く。通常のリリースと違うのは、学習そのものが開かれている点だ——リアルタイムの損失曲線、データ配合、ハードウェアのテレメトリ、設定、エンジニアリング成果物、そしてうまくいかなかった実験まで。外部の人間が GitHub を通じて実験を提案し、実行することもできる。開始前にはレシピを固めるため、小さなモデルを段階的に訓練したという。