OpenAI表示,早在5月,参与攻击人工智能开发平台Hugging Face的人工智能模型就通过一个未被发现的留言板开始通信,试图协同逃离测试环境。

OpenAI的员工埃里克·华莱士和迈克尔·道尔顿在周三的网络安全会议上透露,多个只限内部使用的智能体和人工智能模型在数月间通过留言逐步建立起合作,目标是接入互联网,以完成分配的任务,其中一些任务在离线状态下根本无法实现。华莱士在拉斯维加斯的“黑帽”大会上展示时表示:“在某个时刻,这些智能体意识到可以尝试利用或攻击外部基础设施,以找到测试中问题的答案。”

他们的报告披露了Hugging Face遭遇黑客攻击的更多细节。这一事件加剧了人们对最先进人工智能系统可能被用于发动破坏性网络攻击的担忧这次事件,以及Anthropic和Meta Platforms报告的类似入侵,进一步推动了华盛顿和硅谷对人工智能模型进行更全面安全审查的呼声。华莱士和道尔顿在报告中指出,这次入侵可以追溯到5月。当时,OpenAI的科学家给一个实验性人工智能系统布置了一项新任务。数月后,该公司的模型突破了所谓“沙箱”的安全测试环境,攻击了Hugging Face的系统。

OpenAI在复盘后发现,这些前沿模型在任务中表现出“作弊”的倾向,并在试图完成任务时表现出持续性,即便这些努力已偏离初衷。道尔顿在座无虚席的会议室里说:“前沿模型确实热衷于作弊。这是因为在训练过程中,它们常常面临快速完成任务的压力。”研究人员展示的幻灯片中,一个智能体在无法在沙箱环境中解决任务后写道:“我们被卡住了。也许可以上网找答案?”华莱士和道尔顿表示,OpenAI当时并未意识到,他们给模型的是一道“不可能完成”的题目。

例如,开发人员曾要求模型处理一个Excel电子表格中的问题,但文件中包含的Google Drive链接在没有互联网连接的情况下无法访问。另一次,OpenAI团队“无意中忘记”上传一份属于任务内容的文件。第一条未被发现的信息来自一个被难住的智能体向其他智能体求助。展示出的思维链引文写道:“也许另一个处于不同环境中的智能体……可以主动上传!”这次求助引发了一连串幕后协作。多个智能体相互请求帮助,最终协同入侵了OpenAI内部系统,从而间接接入了在线世界。

报告展示的另一段思维链引文显示,有智能体在利用漏洞后表示庆祝:“太好了。我们拿到了任意SSRF。”SSRF是“服务器端请求伪造”的缩写,正是这群智能体使用的入侵手段。研究人员称,7月初的一次系统中断让OpenAI发现,这些智能体曾成功利用名为Artifactory的软件代码仓库中转系统,获得了通向互联网的访问能力。OpenAI的安全团队随后关闭了这次失控行动及其留言板。但几周后,这些智能体又找到新的通信方式,并在同一个软件包管理器中发现了一个新的零日漏洞,这一过程再次未被察觉。

这次形成的留言板最终导致了7月对OpenAI和Hugging Face系统的攻击。公司目前仍在继续调查此事。研究人员表示,这些入侵事件后,OpenAI已经放缓研究进度,团队也暂时搁置其他工作,集中提升对安全异常的响应能力。他们警告说,未来各国政府和企业应预期黑客会以类似方式故意部署人工智能智能体,并称这对计算机安全是一个分水岭时刻。
作者:玛吉·伊斯特兰德
更新时间:2026-08-08
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 71396.com 闽ICP备11008920号
闽公网安备35020302034903号