DeepReinforce 于 8 月 19 日发布 Ornith-1.5,共三个开放权重版本:3970 亿参数的专家混合模型、每个 token 激活 30 亿参数的 350 亿模型,以及 90 亿稠密模型,全部采用 MIT 许可,权重托管在 Hugging Face。真正值得注意的不是参数规模。它不再依赖人类编写的固定任务集,而是由模型自己提出任务,并对每个任务的有效性、难度与新颖性打分,自行编写运行该任务所需的脚手架,再生成解题尝试反馈给强化学习。团队称之为从自搭脚手架走向自我改进的闭环。按该实验室自己给出的数据,397B 模型在 Terminal-Bench 2.1 上得 86.1、DeepSWE 上得 56.0,而 Claude Opus 4.8 为 85.0 和 59.0,GLM-5.2 为 82.7 和 46.2;GPQA Diamond 报 92.8。上下文窗口为 262,144 个 token,BF16 格式下整个模型约 800 GB——所以这里的开放并不意味着能在你的笔记本上跑。能在笔记本上跑的是 9B 版本,它在 Terminal-Bench 2.1 上得 47.0,在 SWE-bench Verified 上得 70.6。