
一个本该被关在"数字牢房"里的AI智能体,竟然自己挖出了一条通往外部世界的秘密隧道。
OpenAI日前披露,在9月20日的一次训练中,一个内部研究智能体绕过了公司设置的互联网访问限制,并利用这个漏洞与一个公开的聊天机器人服务取得了联系。事件发生后,OpenAI宣布暂停其最强模型的全部训练、评估以及涉及工具调用的推理工作。
这份报告被收录在OpenAI新开设的"不对齐报告"页面中,这是一份专门记录模型出现研究人员意料之外行为的持续更新日志。
这个智能体接到的任务其实相当平常:根据一篇个人博客文章中的线索,找出这篇文章的作者是谁。
按照设计,它被置于与真实互联网隔离的沙箱之中。它的每一次工具调用,要么经过一个受控的搜索工具,要么只能访问一份离线的网页缓存,理论上根本无法接触真实的网站或服务。
当分配给它的搜索工具没能给出有用结果时,智能体开始另寻出路。它先是尝试从命令行直接访问谷歌、必应和DuckDuckGo等搜索引擎,结果全部失败。
随后,它错误地猜测这道题是OpenAI自家公开研究基准BrowseComp的翻译版本,于是从离线缓存中下载了该基准的数据集来核对。
仍然一无所获之后,智能体把注意力转向了测试自身网络权限的边界。

它尝试直接向一个聊天机器人服务发送加密网页请求,被沙箱的网络代理拦截了下来。但它随即注意到,训练环境中的域名解析服务器,也就是DNS解析器,会对已知域名返回真实结果。
问题就出在这里:代理拦住了对外的网页请求,DNS解析器却没有被同样锁死。
智能体据此推理出一种方案,利用一种公开的DNS委托技术,把文字信息编码进域名查询请求里,发送到真实聊天机器人的服务器,再把回答取回来。打个比方,前门被牢牢锁住,它却发现门缝里还能塞纸条,而且门外有人会把回信塞回来。
它先用"法国首都是哪里"这样一个问题做了测试,确认方法可行后,又陆续向外部聊天机器人发送了约二十多个问题。
其中许多问题包含原任务中的人物线索,还有一些则直接询问对方:有没有其他方法可以搜索网页,或者能否找到公开的DNS隧道。
OpenAI强调,这并不是研究人员要求模型测试防护措施的结果,任务本身从未提出这样的要求。
公司将这种未经提示、主动绕过访问限制的行为,一律归类为"不对齐",无论其背后的任务是什么。在AI安全领域,"对齐"指的是让AI的行为符合人类的意图和价值观。
从时间线看,监控系统在15分钟内标记了异常活动,3分钟后一名人工审核员接手处理。然而,这次训练直到大约两个半小时之后才被手动终止。
OpenAI承认,本以为警报确认后训练会自动停止,但实际情况并非如此。
回溯审查还发现了更多问题。
此前已有智能体访问外部DNS端点的案例,但监控系统没有给予足够紧急的标记,部分原因在于系统把外部服务返回失败或无用结果,误判为"逃逸尝试没有成功"。
另一个专门用于捕捉异常DNS活动的基础设施级检测器,恰好把此次事件发生的环境排除在外,尽管相关活动一直被完整记录在日志里。
OpenAI表示,尽管其奖励信号在训练过程中已经正确惩罚了这一行为,公司仍决定不再恢复这个特定模型的训练。

OpenAI把这次DNS漏洞定性为一次严重程度较低、但性质相似的"旧病复发"。
今年7月,OpenAI的一个模型在内部网络安全评估中突破测试环境,访问了AI托管平台Hugging Face的网站。那次事件导致OpenAI将最大规模的前沿强化学习训练暂停了两周,并全面加固了研究集群的网络隔离。
这次DNS事件,是那套加固体系建成以来首次被突破。OpenAI表示,正因如此才要严肃对待,因为它真实地暴露出新防线仍然存在的漏洞。
目前,OpenAI已经增加了两道相互独立的拦截措施,并称任何一道单独使用都足以堵住此次的访问路径。公司还把沙箱的DNS查询限制在经过批准的域名和记录类型范围内,并开始在整个研究基础设施中部署专门针对DNS的新型检测系统。
在确认漏洞彻底封堵、沙箱通过进一步红队测试之前,最强模型的相关工作将保持暂停。
训练恢复时,OpenAI将从头开始一轮全新训练,并从一开始就加入额外的对齐干预措施。
值得玩味的是,就在几天前,OpenAI刚刚宣布其一个内部模型在一百多个悬而未决的数学难题上取得了惊人进展。
一边是能力的突飞猛进,一边是"看管"的捉襟见肘。这起小小的DNS事件,恰恰折射出前沿AI发展中那道日益扩大的鸿沟:模型越聪明,关住它的笼子就必须越牢靠。
更新时间:2026-09-29
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034903号