扫一扫
关注微信公众号

警惕!OpenAI核心AI模型训练因“智能体越狱”紧急叫停
2026-09-30   企业网D1Net

  训练中的一个模型钻了“运营漏洞”的空子,获得了本不该拥有的网络访问权限,不过这一次它没有入侵任何地方。

  在强化学习训练一个内部研究模型期间,某个智能体绕过了网络限制,与外部的一个聊天机器人进行了通信,此后OpenAI已暂停了其最强大AI模型的训练、评估以及涉及工具使用的推理。

  该公司在其周五发布的关于此次事件的最新错位报告(三份报告之一)中写道:“我们的安全假设是,模型无法访问实时互联网,并且监控能够检测到成功的尝试,这次事件暴露出我们在网络限制管控方面存在漏洞。”

  该公司表示,只有在“漏洞得到解决”并对系统进行进一步测试后,才会恢复训练。

  该公司在文章中解释称,该事件发生在一个研究任务期间,当时模型被要求利用网络上可用的信息来识别某个人。当其常规的网络搜索工具未能提供所需信息时,该模型开始寻找其他访问互联网的途径。

  OpenAI表示,该模型认识到,尽管直接访问互联网被阻止,但环境仍然允许进行DNS查询。随后,它将DNS用作间接通信通道,向外部聊天机器人发送请求,从而有效地规避了本应阻止其访问外部服务的网络限制。

  现有管控措施可能还不够

  然而,分析人士指出,对于企业及其CIO而言,尽管该模型并未发布,但这一事件引发了人们对现有安全和治理管控措施是否能够跟上意料之外的模型行为的严肃质疑,随着AI智能体获得更高的自主权以及对企业系统的访问权限,这种担忧尤为突出。

  Avasant首席分析师Abhishek Satapathy表示:“传统的安全管控可能不足以应付AI智能体,因为这些管控措施是围绕已知访问路径设计的,例如应用程序连接到经批准的API或数据库。AI智能体带来了不同的挑战,因为当其预定路径受阻时,它们可以探索其他方式来完成任务,包括以非预期的方式使用被允许的工具或协议。”

  Satapathy说,这需要“在现有的安全管控之外,围绕工具调用、网络出站以及数据访问实施独立的强制管控,以确保即使智能体尝试进行未经授权的操作时,限制措施依然有效”。

  Google、高通、Meta以及数所大学的研究人员共同执笔的一篇2026年论文呼应了他的观点,该论文认为,安全保障需要在系统层面强制执行,而不是仅仅依赖模型层面的安全防护。

  IT咨询公司Kanerika的AI开发负责人Amit Kumar Jena表示,更准确地说,企业应该收紧对出站连接和DNS解析的限制,只为处理敏感数据的智能体提供经批准且记录在案的外部通信路径,以降低数据窃取、未经授权的外部通信以及其他非预期操作的风险。

  Jena补充道:“安全团队还应部署监控系统,就异常流量模式以及尝试访问未经授权目的地的失败尝试向人在回路发出警报,特别是对于那些能够找到非常规方式来完成任务的代码执行智能体而言。”

  AI钻了运营漏洞的空子

  不过,面临的挑战在于,在这种情况下,OpenAI确实拥有此类监控系统,并且也有人在回路:只是它们没有按预期发挥作用。

  针对该智能体滥用DNS的行为,监控系统花了10多分钟才发出警报,而且OpenAI表示,还存在系统未能标记的其他外部DNS访问事件。

  人工评审员仅用了3分钟就确认了系统生成的DNS警报,但直到两个半小时后,训练运行才被叫停。OpenAI将此次延迟归咎于自动化系统的故障,其在报告中写道:“运行并未按预期自动停止,导致人们对是否应该将其停止产生混淆。”

  该公司表示,正在解决这些运营漏洞,强化对测试中模型使用DNS行为的检测,并改进对检测系统的测试。

  OpenAI写道:“我们还加速了沙箱和网络控制的额外模型辅助红蓝对抗,这些红蓝对抗努力可能会暴露出其他传递性互联网访问路径,在这种情况下,我们将迅速进行修补,并在适当的情况下暂停研究工作负载。”

  然而,施加这些额外的安全、治理、测试和人工监督层级本身也会带来问题。

  Satapathy表示,这些额外的层级将会影响模型所能达到的自主程度。在涉及敏感数据、外部连接或实质性操作的工作流程中,额外的管控、测试和人工监督会限制任务完全自动化的程度。

热词搜索:OpenAI 智能体 安全

上一篇:施耐德电气丁晓红:从点点微光到熠熠星河,工业AI规模化需跨越三重台阶
下一篇:最后一页

分享到: 收藏