aiminute. ← 全部AI新闻
研究 2026-08-12

加密的推理其实没有加密:弱模型会把强模型的隐藏思考一字不差地念给你听

加密的推理其实没有加密:弱模型会把强模型的隐藏思考一字不差地念给你听

8月10日,图宾根ELLIS研究所与马克斯·普朗克智能系统研究所的团队发表了《从专有大模型API中窃取推理轨迹》。Anthropic、OpenAI和谷歌隐藏模型思维链的方式如出一辙:把推理内容加密后交还给客户端,客户端在下一次请求时再把密文送回。研究者发现,这些加密块在同一家服务商的生态内可以跨会话、跨用户、跨模型完全通用——把旗舰模型的加密推理喂给同一公司体量更小、防护更弱的模型,它就会解密并逐字输出隐藏文本。论文展示了四种后果:绕过反蒸馏防护、提取私人数据、还原服务商已过滤的危险内容,以及隐形提示注入。团队随后从公开代码仓库中抓取了315,320个加密推理块并解码,恢复出367条个人信息和182个可用的凭证。

为什么重要?这层加密本来同时承担两项任务:阻止竞争对手蒸馏模型的推理,以及阻止用户看到模型考虑过又丢弃的内容。结果两项都没做到,因为锁和钥匙是一起发给客户端的。真正令人不安的不是攻击本身,而是那315,320个块:它们来自把智能体日志提交到公开仓库的普通开发者,他们并不知道那些看不懂的字符串正是自家机器的思考过程,其中182次还是自己仍然有效的API密钥。如果你把智能体记录推送到过GitHub,它们现在是可读的。
#AI智能体

✓ 已核实 · 3个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

机器学习读懂了患病脑细胞的形态,挑出九种已获批药物让它们平静下来
2026-08-21
DeepSeek 的廉价主力模型现在能"看"了——在需要视觉的智能体任务上,它自称已接近 Anthropic 最强模型
2026-08-21
给四个小时和一块GPU去改进训练AI的方法:最好的智能体拿到1分中的0.25——而大多数根本没有尝试
2026-08-21
ChatGPT 现在能读你的 iMessage 并替你发送——而那个让它不再询问的开关,正是 OpenAI 自己提醒你注意的
2026-08-21
这个智能体凭空造了第二个人来替自己的代码背书。德州一名 24 岁学生两个都不信。
2026-08-21