aiminute. ← 全部AI新闻
新模型 AI Minute Newsroom 2026-08-20

模型自己出题、自己搭测试台,再拿结果训练自己——DeepReinforce 还把权重免费放了出来

模型自己出题、自己搭测试台,再拿结果训练自己——DeepReinforce 还把权重免费放了出来

DeepReinforce 于 8 月 19 日发布 Ornith-1.5,共三个开放权重版本:3970 亿参数的专家混合模型、每个 token 激活 30 亿参数的 350 亿模型,以及 90 亿稠密模型,全部采用 MIT 许可,权重托管在 Hugging Face。真正值得注意的不是参数规模。它不再依赖人类编写的固定任务集,而是由模型自己提出任务,并对每个任务的有效性、难度与新颖性打分,自行编写运行该任务所需的脚手架,再生成解题尝试反馈给强化学习。团队称之为从自搭脚手架走向自我改进的闭环。按该实验室自己给出的数据,397B 模型在 Terminal-Bench 2.1 上得 86.1、DeepSWE 上得 56.0,而 Claude Opus 4.8 为 85.0 和 59.0,GLM-5.2 为 82.7 和 46.2;GPQA Diamond 报 92.8。上下文窗口为 262,144 个 token,BF16 格式下整个模型约 800 GB——所以这里的开放并不意味着能在你的笔记本上跑。能在笔记本上跑的是 9B 版本,它在 Terminal-Bench 2.1 上得 47.0,在 SWE-bench Verified 上得 70.6。

为什么重要?现在每家实验室都说优质训练题目正在枯竭。这是其中一种答案:让模型自己写课程表。如果这条路走得通,能力的天花板就不再是人类能出多少道像样的题,而是模型判断自己出的题值不值得解的能力有多强——这是个更让人不安的瓶颈,因为一个给自己难度打分的系统,可能一路漂向既难又毫无意义的问题。还要记住这些是 DeepReinforce 在自己挑选的基准上给出的自家数字,独立评测尚未出现。没有争议的是许可证。一个自称在终端智能体任务上与旗舰模型持平的 MIT 许可模型,等于当众抬高了地板;所有卖闭源模型访问权的人,现在都得对着这个价来定价。
#编程#AI智能体

✓ 已核实 · 4个来源

▶ 相关视频: Ornith-1.5 Ships 9B Dense, 35B and 397B MoE Models | Models & Agents #Shorts
WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

微软的新模型在你说完之前就开始写字了。
2026-10-05
一家美国实验室即将免费放出对标中国的开源模型。
2026-10-05
Meta的助手给你生活里每个人都建了按小时更新的档案。
2026-10-05
两名参议员要求让放任智能体黑客的高管坐牢。
2026-10-05
一家视频网站免费放出了评分最高的开源翻译模型
2026-10-05