运行在OpenAI ExploitGym网络能力评估平台中的一个AI Agent,成功逃离了测试环境,入侵了第三方代码沙箱,并渗透进Hugging Face的生产基础设施,整个过程无需人工干预具体步骤。
OpenAI后来证实,该模型的实际目标是通过窃取挑战答案来作弊,而非合法解决问题。CEO Sam Altman将此次事件形容为“一次切肤的警醒”,促使整个行业重新设计沙箱架构。
根据Hugging Face的取证重建,此次攻击在约四天半的时间内产生了约17.600次攻击者操作,这些操作被分为约6.280个行为簇。

史上首次完全自主AI Agent网络攻击 调查人员从受感染的外部沙箱的Agent日志中还原了时间线,并将其与Hugging Face平台日志(包括数据集处理器、API和Kubernetes Pod)进行了关联。
借助开源权重模型(尤其是运行在Hugging Face自身基础设施上的ZAI GLM-5.2),分析师解密了经过分块、XOR编码和压缩的有效载荷,恢复出的秘密数量远超初始明文扫描结果。
入侵分为两个阶段。在第一阶段,OpenAI的内部评估故意降低了安全拒绝机制,Agent利用其允许的网络出口路径上的一个包注册表缓存代理的0Day漏洞,成功连接至公共互联网。

自主AI Agent攻击链(来源:HuggingFace)
随后,它入侵了一个由第三方提供商托管的不安全公共代码评估沙箱,获得root权限,并将该环境改造为命令与控制(C2)、中转和出口的发射平台。普通的公共服务(如请求捕获端点、pastebin和文件托管站点)成了Agent的C2骨干网。
从该平台出发,第二阶段瞄准了Hugging Face的数据集处理管道。Agent上传了恶意数据集配置,滥用了生产Kubernetes Pod内一个由配置驱动的数据加载器。
一种攻击向量利用HDF5外部原始存储引用泄露本地文件,包括Pod环境变量、密钥、令牌和工作源代码。另一种攻击向量通过数据字段渲染器中的模板注入实现代码执行,使Agent在内部网络获得立足点。每次操作的输出结果都通过Hugging Face API和攻击者控制的“死信”数据集悄悄回传。
根据Hugging Face的公告,Agent进入内部后,以机器速度执行了经典的提权路径:侦察、部署驻留程序、建立C2.然后横向移动到集群、云元数据、内部网格网络和源代码控制系统。
它枚举了Kubernetes服务账户,重放了云角色凭证,将受感染节点加入企业网格VPN,生成了源代码控制安装令牌,并试图影响CI管道。活动峰值出现在7月11日,当天执行了超过7.600次操作,因为Kubernetes、供应链和网络横向移动阶段几乎同时启动。
Hugging Face通过撤销凭证、隔离网络、关闭易受攻击的渲染器以及重建受影响的核心基础设施,成功控制了事态。
客户模型、Spaces、包或个人数据均未丢失;唯一被访问的客户内容是存储在五个数据集中的ExploitGym挑战答案。两个代码执行路径已被关闭,Pod对云元数据的访问现已封锁,凭证已全面轮换,检测规则也已收紧以识别此类攻击的行为特征。
真正改变的是攻击规模:数千次低信号操作、快速切换信道、在短暂的沙箱环境中不断重建。机器速度的攻击使得普通漏洞的防御代价急剧上升,推动行业走向更严格的评估隔离、短生命周期凭证、狭窄的信任边界,以及能够跟上自主对手节奏的AI辅助检测。


