一、案例背景
1.1 前沿大模型产业的“推理竞赛”与安全困境
2026年,全球人工智能产业已进入以“推理能力”为核心竞争力的新阶段。以OpenAI的GPT系列、Anthropic的Claude系列、Google的Gemini系列为代表的前沿大模型,以及以月之暗面Kimi-K3、DeepSeek、智谱GLM为代表的中国大模型,纷纷将“思维链”(Chain of Thought, CoT)作为模型能力的核心卖点。这些模型在给出最终答案之前,会先进行一段内部“思考”,再将加密后的推理过程以数据块的形式返回给用户——如同将一封信的内容锁进密封信封,用户只能看到信封外观,无法窥探内部文字。
这一设计初衷是双重的:一方面,加密推理过程可以保护模型提供商的商业机密,防止竞争对手通过分析推理模式来逆向工程模型架构;另一方面,它也试图防止恶意用户利用推理过程中的信息进行提示注入或越狱攻击。然而,这一看似精巧的安全设计,在2026年9月被一项研究彻底击穿。
1.2 事件核心:两个Token引发的“蒸馏疑云”
2026年9月,前Google DeepMind研究员Ilia Shumailov与ELLIS Institute Tübingen、MPI-IS博士生Alexander Panfilov联合发表了一篇题为《Stealing Reasoning Traces from Proprietary LLM APIs(从专有LLM API窃取推理轨迹)》的论文。研究揭示了一个影响Anthropic、OpenAI、Google三大前沿实验室的架构级漏洞:大模型的加密推理可以被重放到同一家族的小模型中,无需破解任何密码学算法即可解码出隐藏的推理内容。
更令人震惊的是,研究团队从GitHub和Hugging Face公开的Agent轨迹中,成功解码出了31.5万条隐藏推理,其中部分内容包含API密钥、邮箱地址、内部IP地址等敏感信息。这意味着,即使对话的明文部分被彻底清理,只要加密推理块仍然存在,攻击者就能从中提取出模型当时“思考”过的密码和隐私数据。
……