Anthropic 的 Claude Opus 5 在其 System Card(系统卡)中提供的测试结果中,创下了 Gray Swan 最新基准测试中 Indirect Prompt Injection(间接提示注入)攻击成功率的最低纪录。
该模型将攻击者在 15 次尝试内的成功率降至 2.0%。这一结果使 Opus 5 领先于所有接受测试的其他模型,包括更早的 Claude 版本以及竞争性的前沿系统。
这一发现凸显了业界对间接提示注入日益增长的关注。这是一种安全问题,可能影响连接到文档、网站、电子邮件和业务工具的 AI Agent。


间接提示注入是指恶意指令被隐藏在 AI 系统随后读取的不可信内容中。被投毒的网页、文档或消息可能会试图覆盖用户的任务、泄露敏感信息或触发不安全操作。
当模型能够使用工具、检索数据或在企业环境中执行操作时,危险程度会进一步增加。仅靠强大的模型行为并不能消除风险,但可以降低恶意指令成功改变 Agent 决策的可能性。
在 IPI 基准测试中,Opus 5 相比 Claude Opus 4.8 有了显著提升。其 15 次尝试的攻击成功率从 5.5% 降至 2.0%。在单次尝试场景下,该比例从 0.5% 降至 0.2%。
这些结果也超越了 Claude Sonnet 5 和 Claude Mythos 5:前者在 15 次尝试中的成功率为 5.9%,后者为 2.6%。Anthropic 表示,Opus 5 是该基准测试条件下评估过的最稳健的模型。
Claude Opus 5 将提示注入攻击成功率降至 2%


Gray Swan IPI 基准测试(2026 年第一季度)中的间接提示注入攻击(来源:Anthropic)
与非 Claude 系统的差距更大。Muse Spark 是测试中表现最强的非 Claude 模型,其在 15 次尝试内的成功率为 16.5%。
这一数值是 Opus 5 报告成功率的八倍以上。GPT 5.6 Sol 被描述为能力最强的变体,其成功率达到了 20.0%,接近 GPT 5.5 的 20.8%。
Claude Opus 5 的系统卡报告称,Sol 被成功攻击的可能性是 Opus 5 的十倍。GPT-5.6 Terra 和 Luna 的攻击成功率更高,分别为 30.4% 和 43.9%。
单次尝试的对比同样值得注意。对 GPT 5.6 Sol 的单次攻击尝试成功率为 3.1%。这一数字超过了 Opus 5 的 2.0% 成功率——后者是在 15 次尝试后才达到的值。
这一对比表明,Opus 5 的防护机制能够更有效地抵御反复的对抗性提示。然而,基准测试分数不应被视为对现实世界安全性的完整衡量标准。
对于安全团队而言,这些结果强化了围绕 AI 部署建立分层防御的必要性。组织应继续将可信指令与不可信数据分离,限制工具权限,对敏感操作要求确认,并监控 Agent 的活动。
基准测试的领先地位固然有用,但并不能使提示注入变得不可能。攻击者可以改变载荷、利用工作流弱点,并针对集成环节而非仅针对模型本身发起攻击。
关键的操作性问题在于,AI 系统在遇到恶意内容时能否安全地失败。Opus 5 的结果显示出有意义的进展,但企业仍需负责构建安全架构、进行测试和应急响应。
安全负责人还应在授予 Agent 在真实工作流中进行广泛生产访问权限之前,开展红队演练,模拟恶意文件、检索到的 Web 内容以及被攻破的第三方数据源。


