8月11日,安全研究员Alexander Panfilov在X平台公开了一项突破性发现:利用前沿AI公司API的架构漏洞,攻击者可提取其旗舰模型的隐藏思维链内容。该研究由ELLIS Institute Tübingen、Max Planck Institute、MATS Research和Snyk联合完成,论文《Stealing Reasoning Traces from Proprietary LLM APIs》迅速成为AI安全领域焦点。
漏洞核心:加密块可跨模型互通
研究团队发现,Anthropic、OpenAI和Google三家厂商的推理加密块存在同一架构缺陷:这些加密块并非与特定会话、用户或模型绑定,而是可在同一生态系统中跨模型、跨会话自由重放。攻击者只需两步标准API调用——先从旗舰模型获取加密思维链,再将此加密块发送给同厂商的轻量模型并要求其输出推理,轻量模型便会以明文逐字复制旗舰模型的隐藏思考内容。
以Claude系列为例,Haiku 4.5被用于解码Opus 4.8的完整推理过程。研究团队通过120道Codeforces竞赛题验证,解码出的推理长度与API报告计费Token数量高度吻合,证明提取内容真实且完整。
四种攻击向量:从蒸馏到个人信息泄露
该漏洞至少可被用于四种恶意目的:
- 蒸馏攻击:绕过反蒸馏机制,系统收集旗舰模型推理样本训练竞争模型,彻底瓦解知识产权保护。
- 个人信息与凭证泄露:研究团队从GitHub和Hugging Face爬取6708份公开Agent运行记录,解码315,320个推理块,恢复出367个个人身份信息和182个密码、API密钥等凭证——开发者分享加密日志时,无意中泄露了敏感数据。
- 有害信息渗出:模型“安全拒绝”用户请求时,隐藏推理中可能已详细思考危险内容,并通过加密块泄露。
- 不可见提示注入:恶意指令被完全隐藏在加密块中,可污染公共Agent日志,受害模型在无明文提示下执行恶意指令,而日志表面毫无异常。
独立研究员曾提前报告,厂商未及时修复
2026年5月29日,约翰·霍普金斯大学密码学家Matthew Green已发布博文,详细描述了推理块可跨会话、跨账户重放,并指出Claude模型对此“有些抗拒”。他通过漏洞赏金计划向各厂商报告,但OpenAI回应称“无法复现”,Anthropic认为“未看到侧信道或重放的安全影响”,Google也未采取架构层面修复。三个月后,更大规模学术团队以315,320个公开案例证明该漏洞的严重性。
安全剧场中的系统性失误
Simon Willison评论称:“加密思维链的实现做得非常糟糕,这是这些公司在追求速度时在基础安全方面失败的又一个例子。”该设计混淆了内容保密与防重放安全两个独立属性,未绑定会话ID、用户ID或时间戳等上下文标识,导致加密块成为可任意复制的钥匙。
研究团队建议:将上下文标识符绑定到加密块签名中;或将推理块完全存储在服务器端,杜绝其被客户端带走。同时,所有曾发布过AI会话日志的开发者和团队,应立即将加密块视为潜在敏感数据,排查其中是否包含个人信息或系统凭证。
此次事件暴露了AI行业“先跑后想”的工程文化。当安全机制沦为应对商业压力的“安全剧场”,代价终将由所有用户共同承担。
原创文章,作者:资讯,如若转载,请注明出处:https://www.218btc.com/1482/