8月10日,图宾根ELLIS研究所与马克斯·普朗克智能系统研究所的团队发表了《从专有大模型API中窃取推理轨迹》。Anthropic、OpenAI和谷歌隐藏模型思维链的方式如出一辙:把推理内容加密后交还给客户端,客户端在下一次请求时再把密文送回。研究者发现,这些加密块在同一家服务商的生态内可以跨会话、跨用户、跨模型完全通用——把旗舰模型的加密推理喂给同一公司体量更小、防护更弱的模型,它就会解密并逐字输出隐藏文本。论文展示了四种后果:绕过反蒸馏防护、提取私人数据、还原服务商已过滤的危险内容,以及隐形提示注入。团队随后从公开代码仓库中抓取了315,320个加密推理块并解码,恢复出367条个人信息和182个可用的凭证。