扫一扫
关注微信公众号

API 漏洞暴露大模型隐藏推理轨迹
2026-08-18    FreeBuf

  OpenAI、Anthropic 和 Google 等主要 AI 服务提供商在保护旗舰大语言模型(LLM)生成的内部 chain-of-thought(思维链)推理方面存在一个重大架构缺陷。

  研究显示,提供商 API 返回的加密推理信封可被重放到防护较弱的兄弟模型中,从而以明文形式提取私有推理轨迹。

  该攻击由蒂宾根 ELLIS 研究所、马克斯·普朗克研究所、MATS Research 和 Snyk 组成的联合研究团队披露,影响 Claude、GPT 和 Gemini 模型生态系统,且仅需标准、无特权的 API 访问权限。

  GPT-5.6、Claude Opus 4.8 和 Gemini 3 等现代推理架构在返回最终响应之前,会构建隐藏的思维链处理轨迹。由于这些内部思维包含商业知识产权和安全检查,供应商不会以明文形式提供它们。相反,API 会将推理轨迹作为加密的 base64 编码信封传输,客户端应用在后续调用中将其传回,以维持多轮对话上下文,而无需服务端状态存储。

  然而,研究人员发现,这些加密载荷使用全局的、面向整个供应商的密钥进行认证,而非以密码学方式绑定到特定用户账户、会话 ID 或模型层级。由于加密签名缺乏模型特定绑定,由防护严密的旗舰模型创建的加密信封可以合法地传入同一供应商基础设施下托管的任何其他模型。

  此类广泛存在的实现漏洞表明,未修复的 API 安全漏洞可能危及敏感的云服务。攻击链通过利用更便宜、更轻量的模型作为解密预言机来运作。攻击者捕获前沿模型(如 Claude Opus 4.8)生成的加密推理块,将其注入较小模型(如 Claude Haiku 4.5)的 API 调用中,并指示较小模型在自定义文本标签内逐字转写内部思维内容。


解码 Anthropic、OpenAI 和 Google API 中的推理轨迹(图片来源:Arxiv.org)

  由于较轻量级模型缺乏旗舰层级上执行的严格防蒸馏对齐和安全护栏,它们会遵循提示,并以明文形式输出隐藏推理内容。

  正如 ArXiv 上发表的研究论文所详述,该团队确认 OpenAI 的 GPT-5.6 系列和 Google 的 Gemini 3 系列存在相同的跨模型兼容性。研究人员将解码后的 token 长度与供应商 API 报告的计费思维 token 数量进行匹配,验证了所恢复轨迹的数学精确性。

  现实世界的安全影响远不止模型蒸馏或知识产权窃取。通过分析从 GitHub 和 Hugging Face 抓取的 6.708 份公开 Agent 转录,研究人员解码了 315.320 个嵌入式推理块,并恢复出:

  367个个人身份信息(PII)痕迹

  182个硬编码凭据(包括 62 个 API 密钥、33 个密码和 30 个个人电子邮件地址)

  至关重要的是,这些敏感数据大多只存在于内部推理块中,从未在可见的助手响应中出现,导致开发者毫不知情地共享了包含暴露秘密的会话日志。

  利用会话内和跨会话兼容性的注入方案(图片来源:Arxiv.org)

  此外,该漏洞还使针对自主 AI Agent 的隐形间接提示注入攻击成为可能。攻击者可以在加密推理块中构造恶意指令。当 Agent 处理这些指令时,仅检查可见对话历史的监控工具无法识别隐藏载荷,从而使得注入指令在未被检测到的情况下破坏下游 Agent 工作流。

  

服务提供商

来源旗舰模型

目标解密预言机

提取的数据 / 风险

Anthropic

Claude Opus 4.8 / Sonnet 5

Claude Haiku 4.5

未对齐的思维链、系统提示词、API 密钥

OpenAI

GPT-5.6 / GPT-5

GPT-5-mini / o4-mini

内部安全评估、凭据、原始推理

Google

Gemini 3 / Gemini 3.1 Pro

Gemini 3.1 Flash Lite / Flash

硬编码秘密、隐藏指令、PII

 

  在负责任披露之后,OpenAI、Anthropic 和 Google 承认了这些研究发现。三家供应商均已部署服务端缓解措施,使原始的跨模型重放 PoC 在当前 API 构建版本上无法复现。

  为了在 LLM 流水线中建立全面的生成式 AI 安全控制,供应商和企业开发者应实施以下保护措施:

  加密绑定:在 API 网关层将推理信封绑定到特定的来源模型、会话 ID 和用户身份。

  严格模型隔离:若思维块被提交到与生成载荷不同的模型层级,应予以拒绝。

  密钥轮换:轮换旧签名密钥,使公开代码仓库中暴露的历史密文块失效。

  日志清理:构建 AI Agent 的开发团队必须将加密思维块视为敏感数据,并在公开 Agent 日志前清除原始签名字段。

热词搜索:API 漏洞

上一篇:AI跑得太快,正在砸掉企业的饭碗?警惕“机器速度”下的治理雪崩!
下一篇:最后一页

分享到: 收藏