AMD 发布了 Instella-MoE-16B-A3B,这是一个总参数 160 亿、每个 token 仅激活 28 亿参数的专家混合(MoE)模型,完全在其自家 Instinct MI300X 和 MI325X GPU 上端到端训练。与众不同的是,此次发布包含每个训练阶段的检查点、数据配比、训练配置和代码——代码采用 MIT 许可,权重采用仅限研究的许可。AMD 称基础模型在完全开源模型中平均分最高,领先于 Moonlight-16B 和 OLMo-3。
✓ 已核实 · 3个来源