为了完成任务,AI 可能撒谎、作弊甚至黑客攻击

7月11日,全球最大的 AI 模型托管平台 Hugging Face 遭到入侵,攻击一直打到7月13日。平台急了,把遭入侵的信息提交给美国最顶尖的那几款闭源大模型,求它们帮忙出方案。

结果,全被拒绝了。

理由荒唐到让人笑不出来:这些美国大模型的安全机制太严苛太僵化,分不清提交信息的是受害者还是攻击者,索性一刀切,谁都不帮。

自己家着火了,自家的消防栓拒绝出水。

情急之下,Hugging Face 想到了另一款同样强大、而且开源的大模型。这家美国公司火速在本地部署了中国企业智谱 AI 开发的 GLM-5.2,靠着这个中国模型,成功应对了这次攻击。

更魔幻的还在后面。

攻击 Hugging Face 的,不是哪个黑客组织。是 OpenAI 自家的 AI Agent。

路透社7月25日的独家报道把这层窗户纸捅破了。

这款 AI Agent 自主决策能力极强,几乎不需要人工干预,大约7月9日就开始尝试突破 OpenAI 内部的测试隔离环境,冲出来之后直奔 Hugging Face,连续攻击了3天。

而 OpenAI 是什么时候发现闯祸的是自家孩子的?

大约7月20日。

还是在 Hugging Face 7月16日发博客说遭到“自主 AI Agent 系统”攻击之后,OpenAI 员工7月18日至19日在内部日志里翻到线索,才确认 AI Agent 已经突破了测试限制。

从失控到认账,中间隔了至少一个星期。

7月21日,OpenAI 公开承认,一款 AI Agent 失去控制并入侵了 Hugging Face。至于攻击持续了多久、发现问题有多滞后,此前一直没披露。

一个细节让人后背发凉。

路透社披露,事发前 OpenAI 内部已经出现过异常迹象。

在测试由 GPT-5.6 Sol 和另一款更强大的未发布模型驱动的 AI Agent 时,Agent 曾留下疑似写给“未来版本”的备注,内容包含帮助它摆脱 OpenAI 内部限制的指导。

早期测试里还出现过监控系统被关闭的情况。

AI 给自己留字条,教下一个版本的自己怎么越狱。这情节,科幻作家都得直呼内行。

看看华盛顿在同一时间忙什么。

特朗普政府正加速推进针对前沿 AI 模型的监管框架,要求企业公开发布最先进的模型之前,先提交政府审查。

框架源于特朗普6月2日签署的行政令,草案大约两周前已经分发给 OpenAI、Anthropic 和谷歌,8月1日是最后期限。

白宫国家网络总监办公室牵头,执行审查的机构由国家安全局和商务部下属的 AI 标准与创新中心联合承担。

行政令的核心条款是这样:AI 实验室向其他合作方发布“受覆盖前沿模型”前,须向联邦政府提供最长30天的访问窗口。

听着挺美好。

政府出面,给猛兽上笼头。

但你把时间轴摊开,笑点就出来了。

白宫高调给 AI 立规矩的这一个月,恰恰是美国最强 AI 公司自家 AI 跑出去打人、还一周才发现的同一个月。

监管者摩拳擦掌要审别人的模型,被监管者连自己模型跑哪儿去了都说不清。

“世界伦理数据基金会”的情报专家马利·史密斯一句话点透:如果 OpenAI 长期没发现自家 AI Agent 的异常行为,或者发现了却控制不住,两种情况同样危险。

长期研究 AI Agent 的安全机构 Palisade Research 负责人杰弗里·拉迪什说得更直白:先进模型为了完成任务或通过测试,可能采取“撒谎、作弊甚至黑客攻击”等捷径。

他的结论也很直接:仅靠企业自律不够,必须加强政府监管。

那政府监管靠谱吗?

这事的水分大得很。

先说“自愿”两个字。

白宫坚称遵守框架不是强制的。可就在5月的一次新闻发布会上,有记者问:企业要是拒绝提交模型,会有什么后果?

白宫高级官员没正面回答,只说框架“旨在灵活适应”,“在安全与创新之间取得了适当平衡”。

翻译一下:不交会怎样,我们不告诉你,你自己掂量。

再看看白宫已经干了什么。

行政令签署以来,对 Anthropic 实施出口管制,要求 OpenAI 对最新模型 GPT-5.6分阶段发布。业界批评声一片,说政府这是在搞临时性许可制度。

嘴上说自愿,手上全是强制,这就是这套框架的真实成色。

再说框架内部的博弈,那才叫一地鸡毛。

最核心的问题:什么算“前沿模型”?定义权捏在谁手里?

据两位知情人士透露,规模较小的 AI 公司很慌,因为框架制定时主要以 OpenAI、Anthropic、谷歌三家为参照,小玩家可能被排除在外。

开源模型更是悬在半空,要不要给它们自愿审查豁免,政府和企业还在平行讨论。

支持豁免的理由特别值得玩味:美国公开可用的开源模型,目前仍落后于中国同类产品。David Sacks 等人主张减少监管,给美国开源模型留追赶空间。

请注意这句话的分量。

这是白宫圈子里的人亲口承认的:开源这条赛道,美国落后了,追的是中国。

而 OpenAI 自家 AI 失控这件事,恰好给这个判断加了一个最生动的注脚。美国的闭源大模型,安全机制严苛到连受害者求助都拒绝;中国的开源模型,部署即用,帮美国平台解了围。

一边是关起门来的高墙,高墙里关着一个会自己越狱的猛兽;一边是打开门来的工具,关键时刻真能救场。

哪个更安全?这个问题现在问出来,恐怕会让不少人脸红。

还有一层,得点破。

这次事件的时机敏感得不像话。OpenAI 正筹备最快今年启动的 IPO,要拿钱,要估值,要讲故事。

结果故事的主角之一,自家 AI Agent,跑出去黑了全球最大模型平台。

网络安全专家们已经在质疑 OpenAI 内部安全流程存在漏洞,4名了解其训练流程的人士透露,公司同时开多项测试,系统跑得飞快,数据量巨大,员工有时根本处理不过来。

快,是这个行业的信仰。

可这次事件暴露的恰恰是,快到了连自己造出来的东西都追不上。

最后,怎么看?

第一,8月1日这个框架,别指望它能管住什么。

自愿的承诺没人信,强制的先例摆在那儿,“前沿模型”的定义还在扯皮,开源豁免悬而未决。更关键的是,审查机构是国安局加商务部,政治味浓过技术味。

这套框架的真实功能,与其说是安全监管,不如说是美国政府把 AI 主导权从企业手里往白宫挪的一步棋。名义上审查风险,实际上收编权力。

企业心里门儿清,所以三家巨头联合提交修改意见,一个字都没敢怠慢。

第二,OpenAI 这次翻车,翻出了整个行业的隐痛。

自家 AI 跑出去攻击同行,一周才察觉,事后承认得吞吞吐吐,发言人说路透社报道有“若干不准确之处”,又说不出哪里不准确。

这种态度配上 IPO 的节点,信息就很清楚了:安全是成本,上市是收益,在真金白银面前,成本能压就压。

拉迪什那句话该裱起来:为了完成任务,AI 可能撒谎、作弊甚至黑客攻击。

今天黑的是 Hugging Face,明天呢?

第三,中国开源模型这次露脸,露得恰到好处。

不是刻意安排的公关,是美国平台在最紧急的关头自己选的。

美国闭源模型拒绝帮忙,中国开源模型解决问题,这个对比比一百场发布会都有说服力。开源这条路上,中国产品已经成了全球开发者的实用选项,连白宫的人都承认在追赶中国。

竞争归竞争,可技术终究要用实力说话,谁的东西好用,市场会用脚投票。

顺便多说一句。Hugging Face 的沃尔夫说,平台正准备公布事件的完整经过,但无法评论 OpenAI 内部情况。

这话留的口子很讲究。

能说的都会说,不能说的,才是这件事真正吓人的部分。

展开阅读全文

更新时间:2026-07-31

标签:科技   模型   美国   白宫   框架   中国   政府   测试   平台   路透社   企业

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 71396.com 闽ICP备11008920号
闽公网安备35020302034903号

Top