aiminute. ← 全部AI新闻
研究 AI Minute Newsroom 2026-08-25

斯坦福的一个实验室开始了为期三个月、5350 亿参数的公开训练——损失曲线、数据配比和失败实验一并公开

斯坦福的一个实验室开始了为期三个月、5350 亿参数的公开训练——损失曲线、数据配比和失败实验一并公开

Percy Liang 的 Marin 项目已在 11 台 GB200 NVL72 机架上开始预训练 Marin 535B-A23B,这是一个总参数 5350 亿、每 token 激活 230 亿参数的混合专家模型。公开的计划是:18.75 万亿 token,其中 80% 预训练、20% 中期训练,历时约三个月,约 2.7e24 FLOPs,之后再做后训练。与常规发布不同的是,训练过程本身是开放的:实时损失曲线、数据配比、硬件遥测、配置、工程产物,以及那些没跑通的实验,外部人员还可以通过 GitHub 提议甚至运行实验。开跑之前,团队先训练了一组由小到大的模型来确定配方。

为什么重要?公众对大模型训练的了解,几乎全部来自完成的权重和事后写就的论文。判断如何取舍、哪条路走不通、训练在哪几个小时里失稳——恰恰是各实验室不会发表的部分,而这些才是真正的手艺。一次 2.7e24 FLOPs 规模的训练在公开状态下进行,是前沿实验室之外的人第一次能看着这些决定被做出,而且规模足够接近前沿,所学仍可迁移。

✓ 已核实 · 3个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

把枯燥的活儿交给模型之后,与国家关联的黑客团队把攻击量提高了一倍多
2026-08-25
数学家从1948年起就无法回答的一个问题,在周日被一份发到X上的108页文件回答了
2026-08-25
到去年年底,十篇生物医学论文里有九篇带着语言模型的指纹
2026-08-24
约九成高管说人工智能没有提升生产率,但裁员照样在发生
2026-08-24
一个旧版 Claude 在 10 次尝试中 10 次违反了 Anthropic 自己的内容规则——而它仍在 Azure 与 Bedrock 上出售
2026-08-23