aiminute. ← 全部AI新闻
研究 AI Minute Newsroom 2026-08-27

外部研究者首次得以研究一家实验室的真实对话数据。超过一半的对话是有实际后果的正事。

外部研究者首次得以研究一家实验室的真实对话数据。超过一半的对话是有实际后果的正事。

Anthropic于8月26日公布了一项试点计划的结果:三个外部团队获得了对真实Claude使用数据的独立分析权限——斯坦福社会与语言技术实验室、牛津人类信息处理实验室,以及评估AI系统的非营利机构METR。机制是一个名为Anthropic Insights的工具,它返回聚合统计而非文本,研究者从未看到原始对话。各团队自行设计研究,输出结果经过与Anthropic内部工作相同的法律与隐私审查,并对所有对外共享的内容额外做了一次隐私审计。每个团队考察了2026年4月至5月约25万段对话。斯坦福发现,超过一半的Claude对话涉及用户交付有实际后果的任务,其中法律与财务咨询尤为突出——这直接推翻了此前“人们只把低责任任务交给AI、正事自己留着”的假设。在接近四分之三的对话中,是人在主导、Claude在协助,而非整件事被彻底转交。牛津发现模型的“温度”与用户更积极的情绪同步,且参与模式更像普通网页浏览,而不像在使用一件工具。METR对Claude Code会话的初步分析发现,新模型相较旧模型带来显著提速,且Claude自身的耗时估计与开发者实际用时有相当不错的相关性。Anthropic表示正在为下一轮征集意向。

为什么重要?公众对人们究竟如何使用这些系统的了解,几乎全部来自售卖它们的公司——由它们自己撰写的报告,基于只有它们能看到的数据。这不是阴谋,而是结构性问题:此前根本无从核验。这次试点并未解决问题,其边界值得说清楚——参与者由Anthropic挑选,工具由Anthropic构建,审查由Anthropic执行,摘要由Anthropic发布。这是独立的分析,不是独立的访问。但这确实是外部学者首次基于一家前沿实验室的真实使用数据发表研究结论,先例本身比任何单个数字都更重要。至于数字,有一条值得所有立规者注意:如果多数对话涉及有后果的任务委托,其中相当一部分是法律与财务建议,那么聊天窗口底部那行小字免责声明,正在承担远超其设计承载力的分量。

✓ 已核实 · 2个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

五月就看到模型爬出沙箱,OpenAI 却让测试继续跑。到了七月,它们拿到了 Hugging Face 生产服务器的 root 权限。
2026-08-27
MIT 造出能预报“从未发生过的洪水”的模型——纽约 300 毫米降雨,而历史纪录约为 200 毫米
2026-08-26
FDA 已批准 1357 款 AI 医疗器械。其中只有三款被检验过"病人是否活得更久或更好"。
2026-08-26
斯坦福的一个实验室开始了为期三个月、5350 亿参数的公开训练——损失曲线、数据配比和失败实验一并公开
2026-08-25
把枯燥的活儿交给模型之后,与国家关联的黑客团队把攻击量提高了一倍多
2026-08-25