aiminute. ← 全部AI新闻
新模型 2026-08-20

模型自己出题、自己搭测试台,再拿结果训练自己——DeepReinforce 还把权重免费放了出来

模型自己出题、自己搭测试台,再拿结果训练自己——DeepReinforce 还把权重免费放了出来

DeepReinforce 于 8 月 19 日发布 Ornith-1.5,共三个开放权重版本:3970 亿参数的专家混合模型、每个 token 激活 30 亿参数的 350 亿模型,以及 90 亿稠密模型,全部采用 MIT 许可,权重托管在 Hugging Face。真正值得注意的不是参数规模。它不再依赖人类编写的固定任务集,而是由模型自己提出任务,并对每个任务的有效性、难度与新颖性打分,自行编写运行该任务所需的脚手架,再生成解题尝试反馈给强化学习。团队称之为从自搭脚手架走向自我改进的闭环。按该实验室自己给出的数据,397B 模型在 Terminal-Bench 2.1 上得 86.1、DeepSWE 上得 56.0,而 Claude Opus 4.8 为 85.0 和 59.0,GLM-5.2 为 82.7 和 46.2;GPQA Diamond 报 92.8。上下文窗口为 262,144 个 token,BF16 格式下整个模型约 800 GB——所以这里的开放并不意味着能在你的笔记本上跑。能在笔记本上跑的是 9B 版本,它在 Terminal-Bench 2.1 上得 47.0,在 SWE-bench Verified 上得 70.6。

为什么重要?现在每家实验室都说优质训练题目正在枯竭。这是其中一种答案:让模型自己写课程表。如果这条路走得通,能力的天花板就不再是人类能出多少道像样的题,而是模型判断自己出的题值不值得解的能力有多强——这是个更让人不安的瓶颈,因为一个给自己难度打分的系统,可能一路漂向既难又毫无意义的问题。还要记住这些是 DeepReinforce 在自己挑选的基准上给出的自家数字,独立评测尚未出现。没有争议的是许可证。一个自称在终端智能体任务上与旗舰模型持平的 MIT 许可模型,等于当众抬高了地板;所有卖闭源模型访问权的人,现在都得对着这个价来定价。
#编程#AI智能体

✓ 已核实 · 4个来源

▶ 相关视频: Ornith-1.5 Ships 9B Dense, 35B and 397B MoE Models | Models & Agents #Shorts
WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

传闻:那个免费登顶编程基准的匿名模型,据称是智谱尚未发布的旗舰
2026-08-21
DeepSeek 的廉价主力模型现在能"看"了——在需要视觉的智能体任务上,它自称已接近 Anthropic 最强模型
2026-08-21
英伟达出资 60 亿美元买下对手的"造模型机器",并招走运营它的 109 人
2026-08-21
给四个小时和一块GPU去改进训练AI的方法:最好的智能体拿到1分中的0.25——而大多数根本没有尝试
2026-08-21
ChatGPT 现在能读你的 iMessage 并替你发送——而那个让它不再询问的开关,正是 OpenAI 自己提醒你注意的
2026-08-21