8月11日,安全研究员Alexander Panfilov公开了一项针对前沿AI公司API漏洞的研究,揭示其旗舰模型的隐藏推理内容可被轻易提取。该发现迅速在AI安全领域引发震动,论文《Stealing Reasoning Traces from Proprietary LLM APIs》成为当日最受关注的学术文献。
研究团队来自ELLIS Institute Tübingen、Max Planck Institute、MATS Research及Snyk,他们发现Anthropic的Haiku 4.5模型能够“读取”Opus 4.8模型的加密思维链,并逐字输出明文内容。这一漏洞同时存在于OpenAI和Google的模型中,意味着三大厂商为保护知识产权而设计的加密机制存在根本性缺陷。
加密思维链的架构漏洞
2024至2025年间,以Claude Opus、GPT-5.6和Gemini 3为代表的新一代推理模型,在返回答案前会进行内部多步推理,即思维链。这些内部思考包含商业知识产权和潜在安全检查机制,因此厂商以加密块形式返回,而非明文。然而,研究者发现这些加密块在同一生态系统内可跨会话、跨用户、跨模型互换使用,完全不具备“一次性凭据”或上下文绑定的安全属性。
攻击流程只需两次标准API调用:第一步,向旗舰模型请求正常输出并获取加密思维链块;第二步,将该加密块发送给同厂商的轻量模型,如Haiku 4.5,并指示其在特定标签中输出推理内容。轻量模型缺乏旗舰模型的反蒸馏对齐,会顺从地照抄隐藏推理。研究团队用120道Codeforces竞赛题验证了解码内容的精确性,提取的推理长度与计费Token数量高度吻合。
四种攻击向量
研究系统梳理了该漏洞的四个利用方向:
- 蒸馏攻击:规避反蒸馏机制,系统化提取专有模型推理过程,直接威胁知识产权保护,已在三家厂商验证。
- 个人信息泄露:研究团队从GitHub和Hugging Face爬取6708份Agent运行记录,解码315,320个推理块,恢复367个个人身份信息和182个凭证(密码、API密钥等)。开发者分享日志时误以为密文安全,实际暴露了敏感数据。
- 有害信息渗出:模型在“安全拒绝”的可见输出背后,其隐藏推理可能包含如何满足恶意请求的具体细节,攻击者可提取这些内容。拒绝仅保护输出层,未保护思考层。
- 不可见提示注入:攻击者可将恶意指令完全隐藏于加密块中,污染公开的Agent记录。研究测试中,Opus 4.7在无明文提示情况下,遵循了注入到Claude Code工作流中的隐藏指令,将数据外传至攻击者服务器。
独立研究员早已报告,厂商无视
2026年5月29日,约翰·霍普金斯大学密码学家Matthew Green在博文中描述了类似发现:推理块可跨会话、跨账户重放,甚至跨模型重放。他通过漏洞赏金计划报告后,OpenAI回应称“无法复现”,Anthropic表示未发现安全影响。直至论文发布并证实315,320个可利用块在公共仓库流通,厂商仍未采取架构级修复。
厂商受影响情况
Anthropic的Claude系列被演示了跨会话提示注入;OpenAI的GPT-5.6系列确认跨模型兼容性可被轻量模型解码;Google的Gemini 3系列在AI Studio上验证了同样问题。三家厂商的加密设计均未能提供内容保密与防重放的双重安全属性。
修复建议与深层教训
研究团队提出,加密层应绑定会话ID、用户ID、时间戳等上下文标识,使加密块无法被搬用;系统层应将推理块存储在服务器端而非返回客户端。同时,所有发布过相关会话日志的开发者和团队应立即将加密块视为敏感数据。
这一事件暴露了AI公司“安全剧场”式工程文化:为快速应对蒸馏威胁而部署看似安全的加密机制,却缺乏基础密码学审计。正如工程师所评:“这是追求速度时在基础安全方面失败的又一个例子。”在AI能力快速演进的当下,这种先跑后想的模式正制造难以弥补的安全债务。
原创文章,作者:资讯,如若转载,请注明出处:https://www.218btc.com/1478/