先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.09867
偷走「加密思维链」:用同厂商的弱模型解密强模型的推理过程
Stealing Reasoning Traces from Proprietary LLM APIs
Alexander Panfilov,David Schmotz,Ilia Shumailov,Luca Beurer-Kellner 等 8 位作者 · 2026-08-10
加密推理块能跨会话、跨用户、跨模型通用,于是可以让弱模型把它念出来
打开交互式解读 →三个要点
- 问题:主流厂商为保护知识产权、防止蒸馏,把模型的思维链加密后返回客户端,客户端在后续请求中原样传回。作者发现这些加密块在同一厂商的不同会话、用户和模型之间完全兼容、可以互换。
- 方法:把强模型的加密推理块注入同厂商一个更弱、防护更少的模型,迫使它逐字解码输出明文——不需要直接越狱强模型。作者在 Anthropic、OpenAI、Google 三家演示了这一点。
- 结果:可绕过反蒸馏机制;解码从公开仓库抓取的 315,320 个推理块,恢复出 367 条个人身份信息和 182 个凭证;还能读出被最终回答拒绝的危险内容,并把恶意载荷藏进加密块做不可见的提示注入。作者已负责任披露并提出密码学与系统层缓解方案。
182 从公开会话日志的加密推理块中恢复出的凭证数
适合谁读:做模型 API、Agent 平台和 AI 安全的团队;关注蒸馏与模型护城河的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。