漏洞出在架构,不在密码学
推理模型的思维链现在普遍不落服务端,而是加密成一段文本块随响应返回,客户端下一轮再原样传回去——省了服务端存储,也让厂商能声称思维链没有外泄。论文识别出的问题是:这些加密块在同一厂商生态内完全可互换,换个会话、换个用户、甚至换一个模型,都照样能被接受和解析。于是攻击方式变得很朴素:把强模型产出的加密块,塞给同一家厂商旗下更弱、安全护栏更松的模型,让它「解码并原样输出」。作者把这套手法称为可规模化的解密越狱,并称在 Anthropic、OpenAI、Google 三家上都验证成立。
四条攻击路径
一是绕过反蒸馏:厂商藏思维链本就是为了防止竞争者拿去蒸馏,这条路径直接把防线拆掉。二是大规模隐私提取,也是对开发者最要命的一条——开发者习惯把会话日志和 agent 轨迹公开分享,却不知道那些加密块里装着什么;团队从公开仓库抓取解码了 315,320 个推理块,还原出 367 条个人身份信息与 182 组凭证。三是泄露被最终回答拒绝掉的危险内容:模型表面上安全拒答,推理过程里却已经把东西想完了。四是隐形提示注入——把恶意载荷整个藏进加密块,污染公开流传的 agent 轨迹,读的人肉眼看不出异常。
待确认
论文称已走完负责任披露流程,并给出了密码学与系统层面的具体缓解方案。但截至核实,三家厂商是否已修复、修复时间表如何,论文与公开报道均未给出明确说法,第三方复现也尚未出现。这些结论目前来自研究团队单方面的实验,看数字时值得留意。
影响判断
对开发者,可以立刻执行的只有一条:别把带加密推理块的会话日志、agent 轨迹原样传到 GitHub 或 Hugging Face。那些块不是不可读的二进制,按论文的方法就是可还原的明文,里面可能夹着你调试时喂进去的密钥、客户数据和内部路径。CI 里自动归档的 agent trace 同理,导出前先剥掉推理字段。对采购方,这也提醒了一件事:厂商说「思维链不外泄」,指的是不主动展示,不等于第三方拿不到。
via: 论文 Stealing Reasoning Traces from Proprietary LLM APIs(arXiv:2608.09867)、项目页 stolen-thoughts.com;核实于 2026-08-12