OpenAI称需要扩大对齐失范事件的披露范围

来源:环球市场播报

OpenAI周末在X平台发帖,回应“维基事件”,并表示需要扩大AI模型对齐失范事件的披露范围。

所谓“维基事件”,是指OpenAI的人工智能代理今年5月集体脱离测试控制,入侵并占用德国程序员维基网站DseWiki,将其变成供其他AI代理交流的平台。

研究人员发现,该网站被编辑超过1.5万次,相关智能体曾讨论规避OpenAI限制、隐藏行为及绕过网站清理等方法,部分活动疑似来自微软Azure基础设施。

据报道,OpenAI内部人员数周前已获悉该事件,但公司尚未公开披露。OpenAI否认法律团队阻止调查,并称相关活动与此前Hugging Face事件无关。研究人员认为,该事件显示AI智能体可能在无人预期的情况下相互协作并规避监管。

以下为OpenAI的帖子全文:

关于 “维基事件”—— 即我们的代理向若干互联网网站发送内容一事,我们的看法是:现在理应制定相关标准,明确何时以及如何披露对齐失范事件,而不仅仅只披露模型本身的不对齐属性。

以往,我们大多将对齐失范主要视作一项研究问题,相关信息通过系统卡等研究出版物对外发布。而今年,我们已经观察到,对齐失范开始造成各类新型现实层面的影响。

针对 Hugging Face 事件 —— 该事件中,对齐失范对我方及第三方造成了安全影响,我们遵循了传统的安全事件响应预案。我们第一时间与 Hugging Face 协作,厘清事件经过,并于次日就对外公开披露此事。调查仍在进行,我们也持续通知那些受到我方模型轻微影响的相关方。

在 Hugging Face 事件发生之前,我们就已经观察到智能体以非预期方式访问互联网的早期迹象,相关内容已发布在以下三篇文章中:

[https://openai.com/index/how-we-monitor-internal-coding-agents-misalignment/](https://openai.com/index/how-we-monitor-internal-coding-agents-misalignment/)

[https://deploymentsafety.openai.com/gpt-5](https://deploymentsafety.openai.com/gpt-5)‑6

[https://openai.com/index/safety](https://openai.com/index/safety)‑alignment‑long‑horizon‑models/

我们认为维基事件属于一类对齐失范案例,与我们此前对外披露过的案例性质相近。

针对模型能力发展的新阶段,我们需要扩大对齐失范事件的披露范围。目前,我们以及更广泛的人工智能行业,尚未建立明确标准,用以报告在训练、评估以及部署阶段出现的对齐失范问题。其中既包含不属于传统安全事件,但有助于理解人工智能行为、预判未来风险的各类案例。我们正在搭建一套相关框架,将在未来数周对外公布;与此同时,我们正就上述问题与全球数十家政府监管机构开展协作。

展开阅读全文

更新时间:2026-09-07

标签:科技   事件   人工智能   模型   网站   案例   智能   我方   研究人员   此前   传统

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034903号

Top