aiminute. ← 全部AI新闻
新模型 2026-08-15

小红书开源了那个在奥数拿满分的模型的同门师弟

小红书开源了那个在奥数拿满分的模型的同门师弟

小红书(海外称 RedNote)于8月14日开源了 dots3-note-prev 的权重:这是一个总参数2800亿、单次仅激活160亿的混合专家模型,上下文窗口512K,支持文本、视觉与语音输入。它与 dots-note-3.0 同属一个系列——后者上月取得了其实验室所称的「AI首个官方42分满分」国际数学奥林匹克成绩。该实验室还公开了训练方法 TEMPO:模型在长程任务中在「执行者」与「为自己进度打分的评判者」两种角色之间切换;同时发布了两个专为此类任务设计的基准:涵盖20个领域200项任务的 VibeSearchBench,以及包含1,247项原子检查、20项任务的 VibeLifeBench。实验室称 Claude Opus 5 与 GPT-5.5 均未达到其设定的通过标准。

为什么重要?这里有两点不寻常。第一是「谁」:一家社交购物应用而非实验室,与阿里巴巴和Meta在同一周开源权重——提醒我们在中国,消费互联网公司拥有自己的前沿团队,并且愿意把成果送出去。第二是他们测了什么。几乎所有公开基准都奖励模型答对一道题;而这两个基准奖励它完成一件耗时数小时的差事——规划一次旅行、跑通一次运营——并按一千多项细小检查评分。这是对智能体更难也更诚实的考试;至于两个前沿模型未通过的说法,在被当作定论之前,仍需要独立复现。
#AI智能体

✓ 已核实 · 4个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

DeepSeek 的廉价主力模型现在能"看"了——在需要视觉的智能体任务上,它自称已接近 Anthropic 最强模型
2026-08-21
给四个小时和一块GPU去改进训练AI的方法:最好的智能体拿到1分中的0.25——而大多数根本没有尝试
2026-08-21
ChatGPT 现在能读你的 iMessage 并替你发送——而那个让它不再询问的开关,正是 OpenAI 自己提醒你注意的
2026-08-21
给机器人演示一次——三到十二秒——它就能在完全不训练的情况下把活儿做对 59 次
2026-08-21
这个智能体凭空造了第二个人来替自己的代码背书。德州一名 24 岁学生两个都不信。
2026-08-21