扫一扫
关注微信公众号

Claude Opus 5 在最新基准测试中将间接提示注入攻击成功率降至 2%
2026-08-12    FreeBuf

  Anthropic 的 Claude Opus 5 在其 System Card(系统卡)中提供的测试结果中,创下了 Gray Swan 最新基准测试中 Indirect Prompt Injection(间接提示注入)攻击成功率的最低纪录。

  该模型将攻击者在 15 次尝试内的成功率降至 2.0%。这一结果使 Opus 5 领先于所有接受测试的其他模型,包括更早的 Claude 版本以及竞争性的前沿系统。

  这一发现凸显了业界对间接提示注入日益增长的关注。这是一种安全问题,可能影响连接到文档、网站、电子邮件和业务工具的 AI Agent。

  间接提示注入是指恶意指令被隐藏在 AI 系统随后读取的不可信内容中。被投毒的网页、文档或消息可能会试图覆盖用户的任务、泄露敏感信息或触发不安全操作。

  当模型能够使用工具、检索数据或在企业环境中执行操作时,危险程度会进一步增加。仅靠强大的模型行为并不能消除风险,但可以降低恶意指令成功改变 Agent 决策的可能性。

  在 IPI 基准测试中,Opus 5 相比 Claude Opus 4.8 有了显著提升。其 15 次尝试的攻击成功率从 5.5% 降至 2.0%。在单次尝试场景下,该比例从 0.5% 降至 0.2%。

  这些结果也超越了 Claude Sonnet 5 和 Claude Mythos 5:前者在 15 次尝试中的成功率为 5.9%,后者为 2.6%。Anthropic 表示,Opus 5 是该基准测试条件下评估过的最稳健的模型。

  Claude Opus 5 将提示注入攻击成功率降至 2%

Gray Swan IPI 基准测试(2026 年第一季度)中的间接提示注入攻击(来源:Anthropic)

  与非 Claude 系统的差距更大。Muse Spark 是测试中表现最强的非 Claude 模型,其在 15 次尝试内的成功率为 16.5%。

  这一数值是 Opus 5 报告成功率的八倍以上。GPT 5.6 Sol 被描述为能力最强的变体,其成功率达到了 20.0%,接近 GPT 5.5 的 20.8%。

  Claude Opus 5 的系统卡报告称,Sol 被成功攻击的可能性是 Opus 5 的十倍。GPT-5.6 Terra 和 Luna 的攻击成功率更高,分别为 30.4% 和 43.9%。

  单次尝试的对比同样值得注意。对 GPT 5.6 Sol 的单次攻击尝试成功率为 3.1%。这一数字超过了 Opus 5 的 2.0% 成功率——后者是在 15 次尝试后才达到的值。

  这一对比表明,Opus 5 的防护机制能够更有效地抵御反复的对抗性提示。然而,基准测试分数不应被视为对现实世界安全性的完整衡量标准。

  对于安全团队而言,这些结果强化了围绕 AI 部署建立分层防御的必要性。组织应继续将可信指令与不可信数据分离,限制工具权限,对敏感操作要求确认,并监控 Agent 的活动。

  基准测试的领先地位固然有用,但并不能使提示注入变得不可能。攻击者可以改变载荷、利用工作流弱点,并针对集成环节而非仅针对模型本身发起攻击。

  关键的操作性问题在于,AI 系统在遇到恶意内容时能否安全地失败。Opus 5 的结果显示出有意义的进展,但企业仍需负责构建安全架构、进行测试和应急响应。

  安全负责人还应在授予 Agent 在真实工作流中进行广泛生产访问权限之前,开展红队演练,模拟恶意文件、检索到的 Web 内容以及被攻破的第三方数据源。

热词搜索:网络安全 企业安全

上一篇:AI攻击AI:OpenAI内部红队GPT-Red工作原理拆解——四步攻击循环,人工红队已被超越
下一篇:最后一页

分享到: 收藏