aiminute. ← 全部AI新闻
研究 AI Minute Newsroom 2026-08-25

斯坦福的一个实验室开始了为期三个月、5350 亿参数的公开训练——损失曲线、数据配比和失败实验一并公开

斯坦福的一个实验室开始了为期三个月、5350 亿参数的公开训练——损失曲线、数据配比和失败实验一并公开

Percy Liang 的 Marin 项目已在 11 台 GB200 NVL72 机架上开始预训练 Marin 535B-A23B,这是一个总参数 5350 亿、每 token 激活 230 亿参数的混合专家模型。公开的计划是:18.75 万亿 token,其中 80% 预训练、20% 中期训练,历时约三个月,约 2.7e24 FLOPs,之后再做后训练。与常规发布不同的是,训练过程本身是开放的:实时损失曲线、数据配比、硬件遥测、配置、工程产物,以及那些没跑通的实验,外部人员还可以通过 GitHub 提议甚至运行实验。开跑之前,团队先训练了一组由小到大的模型来确定配方。

为什么重要?公众对大模型训练的了解,几乎全部来自完成的权重和事后写就的论文。判断如何取舍、哪条路走不通、训练在哪几个小时里失稳——恰恰是各实验室不会发表的部分,而这些才是真正的手艺。一次 2.7e24 FLOPs 规模的训练在公开状态下进行,是前沿实验室之外的人第一次能看着这些决定被做出,而且规模足够接近前沿,所学仍可迁移。

✓ 已核实 · 3个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

新评分表衡量智能体多常做你没让它做的事。
2026-10-09
谷歌的医疗AI在医生之前先问诊了病人。
2026-10-09
出资18亿美元细胞数据集的公司可以先用它。
2026-10-09
一个符号错误让OpenAI撤下了三篇新数学论文
2026-10-08
布特林说AI数学可能比量子计算机更早破掉加密。
2026-10-08