aiminute. ← 全部AI新闻
传闻 AI Minute Newsroom 2026-08-21

传闻:那个免费的匿名模型仍被指是智谱的——但让它出名的分数只测了十道题,完整跑分很普通

传闻:那个免费的匿名模型仍被指是智谱的——但让它出名的分数只测了十道题,完整跑分很普通

这是一则未经证实的传闻,并作为传闻发布。一个名为 Ox Alpha 的模型于8月20日出现在 OpenRouter 上,供应商匿名,仅标注为'Stealth':免费一周,上下文窗口1,048,576个 token,输出最多131,072个 token,支持文本、图像和视频输入。8月21日,研究者 Ben Davis 发布指纹分析,称他'99%确定'该模型是智谱 GLM-5 家族中一个未发布的成员:视频编码器的 token 消耗与 GLM-5V-Turbo 完全一致,除固定75个 token 的包装差异外 tokenizer 与 GLM-5.3 吻合,对音频输入的拒绝行为相同,错误码同为'1301',输出中的表情符号比例也相近。他表示该分析排除了小米 MiMo、DeepSeek、谷歌、Qwen、xAI、OpenAI 和 Anthropic。这一切都未获证实:截至8月23日,没有任何公司认领 Ox Alpha,智谱也只字未提。还要注意数据问题。OpenRouter 自己的模型页面写明,发送给 Ox Alpha 的提示词与回复由这家匿名供应商保留,只是不用于训练;而 OpenCode 却把同一个模型宣传为'零数据保留'。在供应商公开身份之前,安全的假设是:你发出去的东西,被一家没有告诉你名字的公司留下了。(更正,8月23日:我们最初的报道称 Ox Alpha 在 DeepSWE 编程基准上取得80% pass@1,领先于 Claude Fable 5 的65%、GLM-5.3 的62%和 GPT-5.6-sol 的52%。该数字来自一个10道题的子集——不到基准的9%。Davis 此后跑完了全部113道题,得到约63%,与 GPT-5.6 Sol 持平而非领先全场;他本人也说完整集的数字才是说得通的那个。Ox Alpha 并没有登顶该基准。我们的标题说它登顶了,这是错的。)

为什么重要?更正本身才是这条新闻。一个10道题的结果两天之内以'匿名模型登顶编程基准'的形式传遍全球;推翻它的113道题结果,传播范围远不能相比。每当看到某个模型以巨大优势胜过所有对手,第一个该问的问题是:它究竟被问了多少道题——小样本会制造出巨大的、令人兴奋的、毫无意义的差距。其余部分依然成立:身份未获证实;把一个强模型匿名且免费开放一周,是一条分发渠道,不是一份礼物。基准是你,而在这件事上供应商说它会保留你发出的内容。
#编程

⚠ 未经证实的传闻——请谨慎对待

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

OpenAI 承诺28天每天上新,做不到就重置额度
2026-10-05
大量AI写的报告让谷歌暂停了开源漏洞赏金。
2026-10-04
Anthropic出钱培训一万名工程师来部署Claude
2026-10-04
一个Linux桌面项目彻底拒绝人工智能写出来的代码。
2026-10-04
DeepSeek把自己的智能体搬上桌面,还开放了代码。
2026-10-03