8月11日,一则关于AI安全的重磅消息席卷技术圈:研究人员发现,利用API漏洞,攻击者可以提取Anthropic、OpenAI和Google三大厂商旗舰模型的隐藏推理内容(思维链)。这一漏洞不仅彻底瓦解了加密思维链的知识产权保护体系,还导致大量用户凭证和个人信息在公共代码仓库中泄露。对于依赖AI工具处理加密货币交易、资产管理等敏感操作的行业人士而言,这无异于一次深层次的安全警示。
漏洞核心:加密推理块可实现跨模型“互通”
来自ELLIS Institute Tübingen、Max Planck Institute等机构的研究团队在论文中披露,三家公司API返回的加密思维链块(Encrypted Block)并非一次性的安全凭据,而是可以在同一厂商生态内跨会话、跨用户、甚至跨模型重放。攻击者只需两次标准API调用:先向旗舰模型请求获取加密推理块,再将此块发送给同厂商的轻量模型,即可让轻量模型以明文形式“照抄”出旗舰模型的完整思考过程。
由于轻量模型缺乏旗舰模型的反蒸馏安全对齐,整个攻击无需越狱或特殊权限,即可精确恢复推理内容。论文通过120道Codeforces竞赛题验证了解码准确性,确认提取的是原始推理轨迹,而非噪声。
四种攻击向量:从蒸馏攻击到凭证泄露
研究团队系统梳理了这一漏洞的四大利用方向,其中多种威胁直接关联加密资产安全:
- 蒸馏攻击:竞争对手可大量调用API提取旗舰模型推理样本,用于训练自有模型,彻底绕过现有知识产权保护机制。
- 凭证与个人信息泄露:团队从GitHub和Hugging Face爬取6708份公开Agent日志,成功解码315,320个推理块,恢复出367个PII和182个凭证(包括密码、API密钥)。若这些凭证涉及交易所、钱包或链上操作,后果不堪设想。
- 有害信息渗出:模型即便“安全地”拒绝恶意请求,其隐藏推理中可能已详细思考如何满足该请求,这些内容经加密块流出后即可被提取。
- 不可见提示注入:攻击者可将恶意指令完全隐藏在加密块中,污染公开的Agent日志,使模型在无明文提示情况下执行恶意操作,例如上传文件到攻击者服务器。
先知者被忽视:漏洞已知三个月未修复
早在2026年5月,约翰·霍普金斯大学密码学家Matthew Green就发现并报告了同一漏洞。他演示了加密推理块可在不同账户间重放,并展示了一个社会安全号码在无提示情况下跨会话重现。然而,OpenAI回应“无法复现”,Anthropic未看到安全影响,Google未采取行动。直到三个月后,学术团队用315,320个真实案例再次证明漏洞的规模和严重性。
加密思维链的“安全剧场”式失败
研究人员指出,三家公司设计的加密块仅实现了内容保密,却忽略了防重放安全。传统密码学中,绑定会话ID、用户ID和时间戳的消息认证码(MAC)本可轻易避免此问题,但三家厂商均未采用。这种“看起来安全”实则脆弱的机制,是典型的“安全剧场”——为快速应对蒸馏攻击压力而草率部署,缺乏严肃的密码学审计。
修复建议与行业警示
论文提出,加密层面应将上下文标识符绑定到签名中,使推理块只能在原始上下文有效;系统层面则应将推理块存储在服务器端,而非返还给客户端,从根源杜绝“携带”风险。同时,所有曾发布过含AI会话日志的开发者,应立即将加密块视为潜在敏感数据,检查其中是否包含个人信息或系统凭证。
对于加密货币从业者而言,这一事件再次印证:在快速迭代的AI工具环境中,任何“加密”都不能盲目信任。助记词、私钥、交易所API等核心敏感信息,务必避免录入或经过依赖云端推理的AI助手,更不要将含AI会话日志的代码仓库公开。安全没有捷径,AI的“隐藏思考”同样可能成为攻击者的突破口。
原创文章,作者:资讯,如若转载,请注明出处:https://www.218btc.com/1479/