阿里千问团队开源了 Qwen3.8-Flash-Next 的权重,也就是今天早上挂出倒计时的那个模型。它是一个多模态专家混合(MoE)系统:主网络 1250 亿参数,另加 510 亿参数的 n-gram 嵌入表和 40 亿参数的多 token 预测层——BF16 下总计约 1800 亿,其中每个 token 大约激活 60 亿。架构是全新的:Gated DeltaNet 与 Qwen 稀疏注意力(QSA)的混合、共 512 个专家(10 个路由 + 1 个共享)、门控残差,以及混用 Muon 与 AdamW 优化器的训练配方。原生上下文 262,144 token,可扩展到 100 万。千问自己公布的表格显示:SWE-bench Pro 62.5,对比 Claude Opus 4.6 Max 的 53.4;SWE-bench Multilingual 81.0 对 77.5;DeepSWE 1.1 为 58.7——这些是该实验室在自家测试框架下的数字,尚未经过独立复现。团队称训练成本约为 Qwen3.7-Plus 的九分之一。权重以 qwen-community-1.0 许可发布在 Hugging Face 与魔搭:131 个文件,约 360GB,另有把显存需求减半的 FP8 版本。千问称这是 Qwen4 所依托架构的早期预览,并表示托管版本随后上线,价格为每百万输入 token 0.16 美元、每百万输出 token 0.47 美元。