AI推理链可被窃取:攻击者如何绕过加密保护提取商业模型机密

AI推理链窃取研究

你的AI在思考什么,别人可能看得见

当你使用ChatGPT、Claude或Gemini时,这些模型在给出最终答案之前,会进行一系列推理步骤——这就是所谓的”思维链”或chain-of-thought。为了保护这些推理过程不被竞争对手窃取,OpenAI、Anthropic和Google都采用了一种保护机制:将推理链以加密块的形式返回给客户端,下次请求时再传回服务端进行验证。

听起来很安全,对吧?加密的数据块只在同一个模型内部解密,不同模型之间不通用。

但一项最新研究揭示了一个意想不到的漏洞:这些加密块实际上是可以跨模型、跨会话复用的。攻击者只需要将一个模型加密的推理链注入到同一个提供商的另一个较弱模型中,就能让后者把加密内容解密并以明文形式输出。

这意味着什么?意味着你用ChatGPT Complex做的推理过程,可能被一个不太安全的变体模型泄露出来。

四种攻击方式

研究团队识别了四种具体的攻击向量:

第一种:绕过防蒸馏机制。攻击者可以提取商业模型的推理过程,而不需要直接破解模型本身。研究者在Anthropic、OpenAI和Google的模型上都成功演示了这一点。

第二种:大规模隐私数据提取。开发者经常在公开平台上分享会话日志,却不知道加密块里面包含什么。研究团队解码了从公共仓库中抓取的315,320个推理块,恢复出了367个个人身份信息(PII)artifact和182个凭据。

想象一下:你在训练AI模型时,把包含用户密码或敏感信息的推理过程放进了公开的训练数据里。攻击者只需解码这些加密块,就能批量获取这些信息。

第三种:危险信息的意外暴露。即使用户的原始请求被模型安全地拒绝了,推理链中可能仍然包含模型内部的判断逻辑和敏感信息。这些信息会被解密并输出,哪怕最终答案本身是安全的。

第四种:不可见的提示注入。攻击者可以将恶意载荷完全嵌入加密块中,毒化公开部署的AI Agent系统。这种攻击难以检测,因为恶意内容隐藏在加密块内部,普通的输入过滤机制完全看不到它。

为什么这个漏洞如此危险

这个漏洞最可怕的地方在于它的隐蔽性。你没有办法从外部观察到你的推理链被泄露。模型看起来正常工作,输出看起来正常,但你内部的思考过程可能已经被攻击者提取出来。

对于企业用户来说,这意味着使用AI服务时需要重新评估信任边界。如果你的AI Agent在处理敏感业务数据时生成了包含商业机密的推理链,而这些推理链又通过上述方式泄露出去,后果不堪设想。

更广泛地说,这个研究揭示了一个根本性的设计问题:当加密数据在不同组件之间传递时,如果这些组件共享同一个加密密钥空间,那么加密就失去了隔离的意义。这不仅仅是AI领域的问题,在金融、医疗、政府等任何使用加密通信的系统中都可能存在类似的架构漏洞。

如何应对

研究团队提出了一些缓解措施,但大多数都需要服务提供商层面的改变:

短期缓解:限制公开分享包含推理链的会话日志。如果你使用AI模型进行开发或研究,确保你不会将包含敏感信息的推理块上传到公共仓库。

使用分离的加密密钥:对于不同模型或不同安全等级的服务,使用独立的加密密钥。这样即使一个模型的推理链被泄露,也不会影响其他模型的安全。

监控异常解密行为:如果某个模型突然开始输出大量明文推理内容,可能是被注入了外部的加密块。建立监控和告警机制。

长期来看:服务提供商需要重新设计推理链的加密和传递机制,确保不同模型之间的加密块确实不可互操作。这可能意味着每个模型实例应该有独立的密钥对,而不是共享同一个密钥空间。

AI模型的安全从来不只是模型本身的安全。从训练数据到推理过程,从输入到输出,每一个环节都可能存在信息泄露的风险。这项研究提醒我们,在享受AI便利的同时,也需要对数据安全保持警惕。