扫一扫
关注微信公众号

Hugging Face遭遇AI越狱攻击揭开AI防御的残酷现实
2026-07-30   


  近期Hugging Face平台遭到的入侵,是最近几周曝光的一系列AI辅助入侵事件中的最新一起,这表明攻击者如今已能利用大语言模型(LLM)实现整条攻击链的自动化,但这也暴露了防御者试图利用AI以同样的机器速度进行响应时的局限性:前沿模型上日益保守的安全控制可能会阻碍对调查事件所需的恶意载荷和其他入侵工件的分析。

  该事件是由OpenAI内部对高级模型网络能力的测试失控引起的,GPT-5.6 Sol以及一款能力更强的未发布预发行模型,在放宽了网络拒绝机制且没有使用通常用于拦截高风险活动的生产分类器的情况下运行,它们发现并利用了零日漏洞逃逸沙箱环境,获得了对互联网的无限制访问,并入侵了Hugging Face的基础设施,以寻找其网络安全挑战的答案。

  运营着全球最大的AI模型和机器学习工件托管平台的Hugging Face,通过自身基于LLM的异常检测管线发现了此次入侵,然而,当其安全团队试图使用前沿AI模型分析包含1.7万多个记录事件的入侵日志时,他们却被拦截了。

  “当我们开始进行日志分析时,首先使用的是商业API背后的前沿模型,”该公司在其事件报告中表示,“但这行不通:分析需要提交大量的真实攻击命令、利用载荷和C2工件,而这些请求被提供商的安全防护栏拦截了,因为防护栏无法区分事件响应者和攻击者,于是,我们在自己的基础设施上改用开源权重模型GLM 5.2运行数字 forensics(数字取证)分析,这带来了第二个好处:没有任何攻击者数据及其引用的凭据离开我们的环境。”

  这引发了安全从业者近期观察到的一个重大问题:前沿模型在防御性网络安全工作中的有用性正在下降。AI实验室选择或被迫限制其模型日益强大的网络能力不被滥用,但他们设立的安全控制在很大程度上对身份无感,无法区分攻击者和防御者。

  安全社区已经发现并记录了各种所谓的越狱技术来绕过这些过滤器,但使用此类方法违反了提供商的服务条款和可接受使用政策。虽然黑客不在乎其一次性账号被封禁,但购买企业订阅的安全分析师却很在乎。

  “机器速度的漏洞利用需要机器速度的响应,而这种响应不能运行在拒绝审查证据的模型上。”Suzu Labs安全AI解决方案与网络安全高级总监Jacob Krell表示。

  “防御者日益需要与他们面临的攻击者相当的AI能力,”攻击性安全测试公司Cobalt的CEO Sonali Shah表示,“我们正在进入这样一个时代:防御性AI的质量可能直接决定你理解、遏制和修复攻击的速度,或许更重要的教训是,事件响应不能完全依赖云端托管的AI服务,因为这些服务的安全防护栏可能会在危机期间阻碍有效的数字取证分析。”

  攻击者拥有更多选择

  攻击者在滥用前沿模型进行攻击时并没有遇到太多困难,Anthropic、OpenAI和Google过去都曾报告过其服务上的对抗性AI活动,虽然他们都在致力于建立更强大的防护栏,但攻击者不断找到绕过技术。

  本周,来自Cato Networks的研究人员报告了一起案例:一名名为Trim的威胁行为体正在俄语网络犯罪论坛上推广一款名为“AI Pentest Checker”的AI驱动Web漏洞扫描器。Trim声称,该工具由Claude Opus 4.8驱动,并使用了他基于Anthropic最新且最强Fable 5模型的泄露系统提示词所开发的越狱技术,该威胁行为体在论坛上有分享AI模型越狱技术的历史。

  但攻击者甚至不需要最新的前沿模型就能实现强大攻击的全自动化,甚至Trim过去也指出,像Kimi、GLM和MiniMax这样的开源权重模型是备选方案,而这还是在三月份,早于中国实验室发布GLM 5.2或Kimi K3等最新版本之前,这些新版本进一步缩小了与前沿模型的性能差距,甚至在某些任务上超越了前沿模型。

  大多数开源权重模型也内置了内容安全防护栏,尽管通常比前沿模型弱,但可以通过微调等技术将其移除,这主要是因为它们的权重是公开可用的。来自托管检测和响应供应商ThreatDown的研究人员在Hugging Face上发现了6600多个被标注为无防护栏的AI模型,这些模型带有abliterated、uncensored、decensored、heretic和unfiltered等标签。在30天内,这些模型被下载了超过2.200万次。

  上个月,多伦多大学的研究人员发表了一项研究,他们成功创建了一个AI驱动的自我复制蠕虫,能够自主发现并利用数十个模拟系统中的弱点。研究人员利用了一个可以运行在被劫持GPU上的小型免费AI模型,并通过构建一个配有基于数据库的记忆系统的自定义攻击框架,弥补了内置推理能力的不足,从而保持攻击工作流不偏离轨道。

  “企业应该假设攻击者将越来越多地以机器速度行动,这意味着安全测试、暴露面管理和漏洞修复也必须以机器速度运行。”Cobalt的Shah表示。

  前沿模型受到的限制日益增加

  随着最新一代模型的发布,领先的前沿实验室因过于激进的安全过滤器而受到用户的批评,这些过滤器导致了频繁的过度拒绝现象——模型拒绝处理无害的提示词,或将其路由至能力较弱的模型,其中一些保守设置是出于自律,而另一些可能是由政府压力驱动的。

  Anthropic仅在Project Glasswing项目下,向有限数量的机构提供了Claude Mythos模型的访问权限,用于网络安全测试目的,随后,当它以Fable 5的名字公开发布Mythos级别的模型时,用户报告称,常规的事件响应、检测和基础取证工作流会被自动从Fable 5路由到Claude Opus 4.8.

  6月12日,美国政府颁布了一项出口管制指令,出于对网络滥用和安全风险的担忧,要求Anthropic暂停外籍人员对Fable 5和Mythos 5的访问权限,这些限制已于6月30日解除。

  应美国政府的要求,OpenAI也接连推迟了GPT-5.6系列模型的全面开放(GA),最初仅向一小部分受信任的合作伙伴提供预览版,该公司还指出,该模型的安全防护拦截的潜在有害操作比先前的模型多出约10倍,这可能会带来一些摩擦,尤其是对网络安全用户而言。

  安全专家并不认同这种限制网络安全任务的激进做法能够成功阻止攻击,并认为这弊大于利。

  AI安全公司Knostic的CEO Gadi Evron表示,虽然安全对于整个AI领域来说是首要任务,但目前对模型实施的网络安全限制(尤其是出口管制)是误导性的。“它们无法阻止坏人,却减慢了防御者的速度,事实上是在最需要网络安全知识的时候剥夺了这种知识。”

  “有决心的攻击者将继续使用不受限制的或开源权重模型,或者寻找绕过防护栏的方法,而合规运行的防御者在事件响应期间却失去了获取先进能力的机会,”Cato Networks威胁情报副总裁Etay Maor表示,“你对前沿模型设置的门槛越高,就越会将安全团队推向他们真正能够使用的、具备相当能力的开源权重替代方案。”

  企业需要多模型策略

  安全专家认为,即使企业在大部分任务中都使用基于API的前沿模型,也应该采用一种始终能够访问一个或多个备用模型的策略,就像Hugging Face所做的那样。

  “不同的模型具有不同的优势、可用性和风险特征,因此使用多个模型可以在某个模型不可用、受到过度限制或遭到破坏时提供韧性,”Maor表示,“如果企业选择使用开源权重模型,应该在治理良好的架构内进行,包括强大的访问控制、监控和隔离,而不是假设任何单一模型就是长期的正确答案。”

  使用开源权重模型是有好处的,首先,事件响应通常涉及大量的信号数据和日志事件,这些数据可能包含凭据以及关于环境的其他敏感信息。Hugging Face事件就是这种情况,该公司指出,由于他们使用的是托管在自己基础设施上的GLM 5.2.没有任何攻击者数据或其引用的凭据离开其环境。

  尽管如此,Hugging Face是一家AI基础设施公司,拥有现成的算力来托管如此巨大的模型。大型开源权重模型需要大量的显存(VRAM)才能运行,没有多少企业拥有配备企业级GPU集群的数据中心。在这种情况下,在分析了这些服务的管辖权、数据保留和隐私政策后,他们将需要依赖新兴云(neoclouds)或Amazon Bedrock、Microsoft Azure AI Foundry等服务,因为直接通过官方API使用这些开源权重模型,意味着要与创建它们的中国实验室共享数据。

  多模型架构还需要强大的身份控制、监控、目标范围限定、受限的工具权限、网络隔离、证据处理规则以及对重要操作的人工批准,其目标是在模型对特定任务过于苛刻时保持韧性,而不是赋予AI智能体对环境中每个系统的自主访问权限。

  “企业应该在事件发生前拥有可以在自己的信任边界内运行的、经过审查的AI模型,”Shah表示,“话虽如此,仅靠更好的模型是不够的,用于网络安全的AI仍处于成熟阶段,企业不应盲目信任自主系统。”

热词搜索:OpenAI 智能体 安全

上一篇:31 秒完成攻击闭环:自主 AI 勒索智能体颠覆传统攻防节奏
下一篇:最后一页

分享到: 收藏