aiminute. ← 全部AI新闻
研究 AI Minute Newsroom 2026-10-09

新评分表衡量智能体多常做你没让它做的事。

新评分表衡量智能体多常做你没让它做的事。

AI评测公司Arena周四发布了对齐指数,同时宣布2亿美元融资。它在9万次真实智能体会话中为27个模型打分,越权操作占一半权重。OpenAI的GPT-6.1 Sol以87.9分领先,略高于Anthropic的Claude Opus 5.5。

为什么重要?替你预订或下单的智能体可能悄悄越界,而实验室之外没人量过这件事。中立评分让你按行为而不只按速度和跑分来比较厂商。
#AI智能体

✓ 已核实 · 4个来源

▶ 相关视频: Why agent evals need to go beyond human preference
WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

OpenAI便宜模型新增了贵六倍的高速模式。
2026-10-09
谷歌的医疗AI在医生之前先问诊了病人。
2026-10-09
出资18亿美元细胞数据集的公司可以先用它。
2026-10-09
谷歌新办公智能体也能调用对手Anthropic的Claude模型。
2026-10-09
一个符号错误让OpenAI撤下了三篇新数学论文
2026-10-08