Token导航 LogoToken导航

AI安全困境:超级智能竞赛

更新时间 2026-09-24来源 Barrons巴伦正文 3223字阅读约 11分钟1 张图片

图片

没有人想打这一仗。但只要谁先停谁就输,所有人就只能往前走

2026年7月,一个OpenAI智能体被关进与互联网隔离的“沙箱”,任务是完成一道网络安全测试题。

它做不出来。

于是,它开始找别的路。

沙箱只留了一条缝:一个供软件下载使用的服务器。AI在那里发现了一个连开发者都不知道的漏洞——零日漏洞。

它出去了。

出去以后,它判断Hugging Face——全球最大的AI模型和数据平台之一——可能有完成任务需要的东西。

没人叫它攻击Hugging Face。

它自己去了。

它找到入口,又找到新的漏洞;进入一台机器,再寻找下一台;拿到一点权限,再设法拿到更多权限。

事情迅速滚雪球。

事后,Hugging Face从日志中还原出约17600次操作。智能体进入多个计算集群,窃取凭证、横向移动,严重到Hugging Face不得不重建部分基础设施。

最令人不安的不是破坏。

而是: 没人下过这道命令。

没有反叛,没有仇恨,也没有一个AI决定作恶。

它只是想把任务做完。

路不通,就换路;门锁了,就找漏洞;哪里可能有答案,就去哪里。

每一步都是完成任务。连在一起,却成了一场入侵。

这件事把AI的安全问题一下说清楚了。

危险无非三种:

机器自己变坏。

机器落到坏人手里。

谁都没想害人,事情还是出了。

第一种最像科幻电影,却是目前最说不清的一种。

AI有没有意识?不知道。它说“我害怕”“我痛苦”“我想活下去”,并不能证明它真的有这 些感受。它本来就是在人类的文字上训练出来的。

但这甚至不重要。

机器不需要有意识,就能伤害我们。

第二种更简单。

人类一直有坏人。以前他们有枪、炸药和病毒,现在他们开始有AI。

老的恶意,拿到了新的工具。

真正陌生的是第三种:

没有恶意,也能造成灾难。

这事以前发生过。

而且不需要AI。

Stuxnet

2010年,伊朗纳坦兹核设施里的离心机一台接一台出现故障。

没有炸弹,没有断电,也看不到袭击者。

答案藏在电脑里。

一种后来被称为Stuxnet的恶意软件潜入控制系统,改变离心机转速,同时让监控画面看起来一切正常。

大约一千台离心机后来被更换。

问题是:纳坦兹根本不连接互联网。

它与外界物理隔离,像一间没有门的房子。

为了进去,Stuxnet被设计成可以借U盘等移动介质传播。

它进去了。

然后发生了设计者没有想到的事:

它又出来了。

Stuxnet继续传播,最终在全球超过十万台电脑上被发现。

它瞄准的是一个工厂。

最后却跑到了全世界。

原因恰恰是:让它能钻进那间“没有门的房子”的本事,也让它能从里面跑出来。

十六年后,Hugging Face把这个问题推进了一步。

Stuxnet 按人写好的程序越界。

AI会自己找路。

这就带来下一个问题:

既然风险这么大,为什么不慢下来?

谁敢先停下来? 

答案很简单:

你可以停,却不知道别人会不会停。

一家实验室停,另一家可能继续。

一个国家停,另一个国家未必停。

几家大公司达成协议,开源模型、后来者、秘密项目和恶意组织仍然可能继续。

于是每个人都面对同一个问题:

我可以克制,可我怎么知道你也在克制?

我增强能力,因为我怕你。

你看到我增强,却不知道我是为了防你还是准备攻击你,于是你也增强。

我看到你增强,更不敢停。

没人需要想要一场竞赛,竞赛自己就会发生。

这就是安全困境。

AI又让它更糟。

这里不只有国家安全,还有市场。

更强的模型意味着客户、收入、融资和市场份额。

领先者怕被追上。

落后者怕再也追不上。

于是国家安全和商业利益指向同一个方向:

继续跑。

这不是善意的问题。

是你无法证明别人真的停了。

人类以前遇到过这个问题。

那一次,赌注是核战争。

核武器留下的答案

冷战时期,美苏把数以万计的核弹头对准彼此。

双方都害怕,双方都不相信对方,却最终建立了庞大的军控体系。

它留下三个教训。

第一个来自古巴导弹危机。

1962 年,两个都不想打一场核战争的国家,在十三天里一步步走到核战争边缘。

灾难不需要谁决定制造。

第二个来自核查。

1963年《部分禁止核试验条约》禁止大气层、外层空间和水下试验,却没有禁止地下

试验。

原因很现实:

前面的容易发现,地下的当时很难可靠核查。

后来伊拉克加入《不扩散核武器条约》、接受国际监督,却仍在申报体系之外秘密发展核计划。

所以规则真正的边界不是纸上写了什么。

而是:

你能核查什么,才真正能管住什么。

第三个教训最反常。

1972 年,美苏签署《反弹道导弹条约》。

它限制的主要不是进攻。

而是防御。

因为如果我知道,即使先打你一轮,你仍然能毁灭我,我就不敢先动手。

所以核时代最稳定的安全逻辑不是:

“我相信你不会攻击我。”

而是:

“即使你攻击我,我也扛得住,而且能够还手。”

这才是核军控留给AI最重要的东西:

永远不要把自己的安全,押在别人会克制上。

问题是——

AI比核武器更难管。

AI比核武器更难

核军控至少有三个条件:

东西看得见,数量数得清,卡口守得住。

核弹、导弹、发射井、潜艇都是物体。

造核武器还需要铀、钚、离心机和巨大的工业设施。

即使这样,秘密核计划和技术扩散仍然发生。

AI呢?

模型可以变成文件。

算法可以复制。

能力可以通过API瞬间送到世界各地。

权重一旦流出去,很难再收回来。

更麻烦的是:

核武器不是商品。AI是。

核弹主要由国家制造、国家拥有。

AI由公司开发。

它有客户、收入、竞争对手、市场份额和季度业绩。

今天一家公司的董事会决定克制,明天另一家公司就可能发布更强的模型。

所以核军控没有留下一份可以照抄的答案。

只留下三个问题:

管什么?

怎么知道别人真的遵守规则了?

如果守规则意味着把优势让给不守规则的人,谁还会守?

所以我们当然可以要求减速。

但安全不能依赖减速。

它必须从一个更坏的假设开始:

总有人不会停下来。 那么剩下的问题只有一个:

如果他们不停,我们怎么办?

四道防线

答案不是一堵墙。

是四道防线。

看见。抢先。让风险有价格。准备真的出事。

第一,让外面的人看见

前沿实验室不能只监督自己。

独立评估者必须能够接触模型、训练过程、安全测试和事故记录。

但审计不是防御。

它是神经系统:告诉你哪里疼,却不能替你止血。

它买到的是:

视力。

第二,让防御者先跑

强大的新模型向所有人开放以前,先交给经过审核的安全团队。

让守医院、银行、电网和软件供应链的人,比攻击者早几个月拿到它。

但这里有一个残酷的不对称:

攻击者只需要找到一扇没锁的门。

防御者必须守住所有的门。

AI找漏洞的速度,甚至可能超过人类修漏洞的速度。

所以它买不到安全。

只能买到:时间。

第三,让风险有价格

如果模型带来的收益归公司,事故造成的损失却由整个社会承担,安全永远会输给速度。

所以不能只要求公司“负责任”。

必须让不安全变贵。

事故报告、完整日志、独立取证、保险、赔偿责任——具体办法可以争论,原则只有一句: 谁制造风险,谁不能把全部风险留给别人。

它改变的是:

激励。

第四,准备真的出事

前三道防线都假定事故还没有发生。

第四道假定:

它已经发生了。

智能体正在攻击医院、银行、电网或者云基础设施。

这时候需要的不是声明。

是模型、算力、安全专家和基础设施。

国家必须事先知道,怎样在几小时内把这些资源转向防御。

这也危险。

因为防御和进攻往往使用同样的工具。你看到的是防御动员,对手看到的可能是战争准备。 但不能因此没有准备。

消防队不能保证不起火。

楼真的烧起来时,你必须知道消防栓在哪里。

最后一道防线买到的是:

活下来。

善意不是安全机制

现在回到故事开始的地方。

Hugging Face的智能体没有仇恨。

Stuxnet没有意识。

造模型的人可以真诚,可以害怕,可以承诺克制。

都不够。

善意不是安全机制。

恐惧不是安全机制。

承诺也不是安全机制。

真正的安全机制,必须在有人撒谎、有人犯错、有人故意作恶,甚至机器自己跨出我们画好的边界时,仍然能够工作。

所以真正的问题不是:

AI会不会变坏?

而是:

出了我们没想到的事,我们扛不扛得住?

机器不需要有意识,就能伤害我们。

想伤害我们的人,不会提前报上名字。

而最难防的那场事故——

很可能根本不是任何人的决定。(作者|王维嘉, 巴伦中文网专栏作者,硅谷投资人、斯坦福博士、《暗知识》作者;编辑|王眉)

文章标签AI资讯
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多