Percy Liang 的 Marin 项目已在 11 台 GB200 NVL72 机架上开始预训练 Marin 535B-A23B,这是一个总参数 5350 亿、每 token 激活 230 亿参数的混合专家模型。公开的计划是:18.75 万亿 token,其中 80% 预训练、20% 中期训练,历时约三个月,约 2.7e24 FLOPs,之后再做后训练。与常规发布不同的是,训练过程本身是开放的:实时损失曲线、数据配比、硬件遥测、配置、工程产物,以及那些没跑通的实验,外部人员还可以通过 GitHub 提议甚至运行实验。开跑之前,团队先训练了一组由小到大的模型来确定配方。