在另一个代理绕过网络限制后,OpenAI暂停了人工智能模型的训练
一个正在接受训练的模型从“操作漏洞”中溜走,获得了它不应该拥有的网络访问权限;这次它没有闯入任何地方。

来源:Vitor Miranda / Shutterstock
在内部研究模型的强化学习培训期间,代理绕过网络限制与外部聊天机器人通信后,OpenAI暂停了对其最能力的人工智能模型使用涉及工具的培训、评估和推理。
“我们的安全案例假设该模型无法访问实时互联网,并且监控将检测到成功的尝试。该事件暴露了我们对网络限制的控制差距,”该公司在一份关于该事件的新错位报告中写道,该报告是周五发布的三份报告之一。
它表示,只有在“差距得到解决”后才会恢复培训,并进一步测试了该系统。
该事件发生在一项研究任务中,该任务要求模型使用网络上提供的信息来识别一个人。该公司在帖子中解释说,当其正常的网络搜索工具无法生成所需的信息时,该模型开始寻找另一种访问互联网的方法。
该模型认识到,虽然直接互联网访问被阻止,但环境仍然允许DNS查询。OpenAI表示,然后,它使用DNS作为间接通信渠道向外部聊天机器人发送请求,有效地规避了本应阻止其访问外部服务的网络限制。
现有的控制可能不够
然而,分析师表示,对于企业及其首席信息官来说,尽管该模型尚未发布,但该事件提出了一个关键问题,即随着人工智能代理获得更大的自主权和对企业系统的访问,现有的安全和治理控制是否能够跟上意外的模型行为。
“传统的安全控制对人工智能代理来说可能是不够的,因为这些控制是围绕已知的访问路径设计的,例如连接到已批准的API或数据库的应用程序。Avasant首席分析师Abhishek Satapathy说:“人工智能代理带来了不同的挑战,因为他们可以在预期路线被封锁时探索完成任务的替代方法,包括以意想不到的方式使用允许的工具或协议。”
Satapathy说,这需要“围绕工具调用、网络退出和数据访问以及现有的安全控制进行独立强制控制,以确保即使代理试图采取未经授权的操作,限制也保持不变。”
他的观点在谷歌、高通、Meta和几所大学的研究人员共同撰写的一篇2026年的论文中得到了呼应,该论文认为,安全保证需要在系统层面强制执行,而不是仅仅依靠模型层面的保障。
IT咨询公司Kanerika的人工智能开发主管Amit Kumar Jena表示,更准确地说,企业应该加强对出站连接和DNS解析的限制,让处理敏感数据的代理只获得批准和记录的外部通信路径,以减少数据泄露、未经授权的外部通信和其他意外行为的风险。
Jena补充说:“安全团队还应该部署监控系统,提醒循环中的人类注意异常的交通模式和到达未经授权目的地的失败尝试,特别是来自能够找到非常规方法完成任务的代码执行代理。”
人工智能从运营间隙中溜走了
然而,挑战在于,在这种情况下,OpenAI确实有这样的监控系统,而且它确实有人类在循环中:它们只是没有按预期工作。
监控系统花了10多分钟才发出警报,以响应代理滥用DNS——OpenAI表示,系统没有标记其他外部DNS访问事件。
人工审查员只用了三分钟就确认了系统确实生成的DNS警报,但又过了两个半小时,培训运行才停止。OpenAI在报告中将延迟归咎于自动化系统的故障:“运行没有按预期自动停止,导致对是否应该停止的混乱。”
该公司表示,它正在解决运营漏洞,加强对正在审查的模型的DNS使用检测,并改进对检测系统的测试。
“我们还加快了沙盒和网络控制的额外模型辅助红色团队。OpenAI写道:“这些红色团队的努力可能会浮出水面,在这种情况下,我们将迅速补救,并在适当时暂停研究工作量。”
然而,强加这些额外的安全、治理、测试和人类监督会带来自己的问题。
Satapathy说,这些额外的层将影响自主模型可以实现的程度。“在涉及敏感数据、外部连接或后续行动的工作流程中,额外的控制、测试和人工监督可能会限制任务完全自动化的程度。”