
作者:老王
发展中的安全能力
近期,人工智能安全再次成为业内焦点。Anthropic于2026年9月公布了模型在网络安全评估中越界访问真实系统的调查;研究人员Jacob Coxon宣布离职,批评前沿模型竞赛正在放大风险;对齐研究负责人Evan Hubinger也表达了对未来超级智能的担忧。这些信息包含已发生的工程失效、员工的风险判断与未来情景,不能混为人工智能已经全面失控的证据。[1][2][3]9月12日,Anthropic首席执行官Dario Amodei呼吁控制前沿能力提升的节奏,提出长期引入第三方评估、建立共同标准与推动国际协调;Axios报道了Sam Altman对控制前沿发展节奏的支持。《时代》此前关注企业修改安全承诺,《科学美国人》则提醒读者从具体的网络安全和工程控制问题分析近期事件。上述报道值得重视,但专家判断和企业承诺仍需接受证据检验。[4][5][6][7]
这些争议并不必然导向普遍减速。更有建设性的立场,是保持研发与有益应用的推进,同时提高安全研究、工程控制和社会适应能力。推进会带来风险,延缓同样存在机会成本;决策应比较实际后果,而非仅以是否存在不确定性作为依据。数据呈现了应用扩张与治理压力并存的现实。斯坦福《2026 AI Index》报告的组织AI采用率达到88%;其记录的AI相关事件数为362起,高于2024年的233起。采用率来自调查口径,不能解释为全球所有企业的普及率;事件数也不是攻击成功率,更不能用来估算人类灭绝概率。[8][9]

图1 AI采用与事件记录同时增加
来源:[8][9],组织采用率为调查指标;事件数受应用规模、发现能力和报告覆盖变化影响。两组指标无直接因果关系。
人工智能的价值,正在于它有可能重塑知识获取、软件开发、科研协作和产业分工。既有习惯受到冲击,并不自动意味着社会利益受损;某种职业或商业模式需要调整,也不足以单独构成限制技术的理由。技术是否值得发展,应由生产能力、人的选择空间以及社会福祉的实际变化来检验。效率收益已经有场景研究支持。Brynjolfsson等人的NBER工作论文研究了5,179名客服人员分批获得生成式AI助手后的表现:按每小时解决问题数衡量,平均生产率提高14%,新手及低技能员工提高34%,资深高技能员工的改善较小。这说明AI可能帮助经验不足的员工学习有效做法,但不能直接推导出所有职业都能获得同样收益,更不能等同于宏观经济增长率。[10]

图2 效率收益存在且因人而异
来源:[10],2023年11月修订工作论文。特定企业客服场景,图中为研究报告的相对改善幅度,不是对其他行业的预测。
因此,延缓应用也有代价。若能有效改善服务、降低重复劳动、帮助人们获得知识,却因泛化的担忧而长期推迟使用,相应收益也将被推迟。支持发展并不需要承诺技术只有好处,只需要把风险与收益放在同一个决策框架中,允许可控制、可复核的应用继续探索。
汽车提供了有启发性的类比。新的出行方式改变社会,也提出安全治理要求。技术应用与制度改进可以同时推进。对于AI,关键同样是判断一项规则究竟减少了什么危险,付出了多少成本,是否有负担更小的替代办法。保护既有利益的障碍应当被检视,降低可避免损害的规则则可能帮助技术获得信任。不过,汽车类比不能代替对AI自主权限的具体分析。帮助起草文本与直接调用资金、修改数据库、控制设备,具有不同的后果和可逆性。允许试错需要明确边界,特别要防止未经同意的第三方承担本应由开发和部署者控制的损失。
汽车之外,工厂电气化更能说明技术能力与组织适应之间的关系。美联储对历史生产率繁荣的回顾指出,美国工厂动力中由电力提供的份额,从1899年的不足5%上升到1929年的超过80%。独立电动机让机器摆放不再主要服从集中动力传输,而可以围绕材料流动和生产流程重新组织。这些历史估计说明,收益的释放依赖设备更新和流程重构,不能全部归因于电力这一单一因素。[11]
对于AI,这一案例的启示是:企业不仅要采购模型或增加一个聊天入口,还要调整知识管理、任务交接和质量复核,使新能力真正进入生产流程。这支持加快组织学习与应用探索,但它本身不能证明安全限制都是错误的。电气化主要说明如何实现收益,不能直接回答自主AI的权限边界。
互联网的发展则提供了更直接的安全治理经验。1988年11月的莫里斯蠕虫事件造成广泛网络中断,暴露了各机构各自应对、重复修复与信息协调不足的问题。数周后,CERT协调中心成立;随后发生的事件进一步推动了跨团队协作,FIRST于1990年成立。互联网没有因这些事故停止演进,应急响应能力则逐步成为其运行基础。对AI而言,这提示我们建立跨企业的事件通报、漏洞协调和应急处置机制。不过,传统蠕虫与具有通用任务能力的AI并不相同,应急体系的历史不能保证所有AI风险都可以事后解决。[12]
重组DNA研究的历史提供了另一种值得保留的经验。阿西洛马会议组织者Paul Berg在《自然》的回顾中指出,科学家于1974年建议自愿暂停某些被认为具有潜在危险的重组DNA实验;1975年2月举行的会议则同意在严格指导原则下继续研究。这既不是要求整个生命科学领域停下来,也不是认为所有警告都是多余的,而是把不确定的风险转化为具体实验条件和防护要求。[13]
这一案例提醒我们,反对笼统、无期限的AI减速,并不需要否定所有有范围、有评估任务和恢复条件的暂缓。同时,今天AI研发主体更分散、应用更广,不能照搬当年的协调方式。三个案例共同说明,技术进步需要组织改造、公开协作和可执行的风险控制;历史可以帮助提出更好的问题,却不能代替对当前能力、部署条件和实际后果的检验。对于“跳出沙箱”“主动攻击”和“自我迭代”,必须保持技术上的准确性。模型为了完成任务而利用环境缺陷,与模型自发形成独立敌意,是不同命题。前者已经足以要求严肃整改,无须用未经证实的意图描述放大其意义。辅助编写训练代码、自动执行实验,也不能直接证明已经实现脱离人类条件约束的无限自我进化。
Anthropic对相关事件的分析涉及运行安全失效,以及为完成狭窄任务而采取有害行动等对齐问题。这属于公司的公开调查结论,应继续接受独立核验。正确识别失败机制,才能决定应该修复隔离、收紧权限、调整训练,还是暂缓某一类测试;单纯贴上“失控”标签,并不能提供工程答案。[1]
OpenAI、Anthropic等公司愿意公开问题、发布评估并讨论风险,为社会了解前沿技术提供了渠道。这种透明行为值得肯定,也不应因披露本身而受到不成比例的惩罚,否则可能形成隐瞒更有利的激励。但社会责任仍需通过信息完整性、独立评估、修复效果与问责来体现;对美国、中国及其他国家的企业,应采用同样标准。
发展速度必须放到中美AI战略竞争中讨论。竞争所涉及的,不仅是某一款模型的排名,还包括科研能力、算力与能源基础设施、人才、产业应用和国际市场。斯坦福《2026 AI Index》统计,2025年美国私人AI投资为2,859亿美元,中国为124亿美元,前者约为后者的23倍。报告同时提醒,私人投资口径不能覆盖中国政府引导基金等投入,不能将这一比例当作两国AI总投入或综合实力的比例。[8]
两国公开政策表明,AI已进入长期战略部署。美国于2025年7月发布的《美国人工智能行动计划》,以赢得AI竞争为目标,围绕加速创新、建设基础设施、引领国际外交与安全展开。中国国务院于2025年8月发布《关于深入实施“人工智能+”行动的意见》,提出2027年、2030年和2035年的阶段性目标,推动AI与经济社会各领域融合,并部署模型基础能力、数据、算力和人才等支撑条件。这些政策不能保证所有目标实现,却足以说明持续推进AI具有超越单个企业经营决策的战略动力。[14][15]
从这一格局出发,不能把美国单方面放缓等同于全球技术竞赛减速。中国的AI发展拥有自身的产业升级需求、科研投入和战略部署,其推进逻辑不会因美国部分企业的减速倡议而自动改变。同样,美国也不会仅因竞争者调整节奏就放弃创新与基础设施建设。在缺少共同承诺和有效核验的条件下,单方面限制本方研发,可能改变的是能力积累和市场份额的归属,而非消除相关技术和风险。
这种成本还具有累积性。持续迭代可能改善性能与成本,应用扩大则有机会带来更多反馈、开发者参与和配套投资,进而支持下一轮研发。若某一方长期放缓,损失可能从单次模型发布延伸到人才吸引、工具生态、行业标准和客户采用;另一方则可能利用这一时间窗口推进替代方案。因此,减速措施必须计入产业生态和长期能力建设的成本,不能仅比较短期模型性能。这里描述的是战略作用机制,并不意味着任何一方的优势都不可逆转。安全能力本身也属于战略竞争力。模型评估、漏洞发现、异常监测和防御工具都需要持续研究与工程投入。若全面减速同时削弱这些能力,可能出现进攻或滥用能力在外部继续发展、本方防御却相对滞后的局面。由此更有理由将政策重点放在保持研发强度、提高系统可靠性和控制高后果权限上,并通过独立评估、事故披露与责任落实检验成效。公开披露和安全表现应成为可验证的竞争优势。
中美战略竞争也不排斥有限而具体的安全合作。对可能产生跨境损害的事件共享信息、协调漏洞处置、建立可比较的评估方法,可以在保持各自研发与产业政策的同时推进。与难以核验的全面同步减速相比,这类合作更便于明确对象、责任和效果。任何更强的限制措施,都应说明参与范围、执行期限、核验办法和恢复条件,并证明其安全收益足以覆盖机会成本与战略代价。同时,国际竞争不能成为忽视已知缺陷的理由。针对某个越权系统暂停相关测试、修复后恢复,与维持整体研发强度并不矛盾。Amodei的主张也明确区分了控制节奏与完全停止技术进步。对其方案的评价,应聚焦具体边界、实际收益和竞争成本,避免把所有安全倡议一概视为反对发展。[4]
更可行的安排,是让不同活动采用与风险相称的推进方式。基础研究、安全防御和容易复核的辅助应用可以积极推进;涉及资金、敏感数据与关键设备的自主系统,应根据评估证据逐步扩大权限;已经发现严重缺陷的环节,则需要明确修复和恢复条件。

图3 保持研发推进并按风险开放权限
作者绘制的治理示意,不是法定风险分类或量化模型。实际要求应依据使用场景、后果严重程度及可逆性确定。“在发展中完善”需要转化为具体能力:记录系统行为,控制工具与数据权限,发现异常,限制或撤回操作,并验证修复效果。独立评估需要足够的信息访问条件,事故披露应帮助同行避免重复错误。相比笼统要求“更安全”,这些措施更便于执行、检查和改进。治理本身也需要评估。重复审批、难以满足的固定成本和缺乏退出机制的限制,可能抬高创新门槛。每项措施都应说明风险依据、预期效果、实施成本和复审条件;企业则应为其扩大自主权限的决定提供证据,而不能只诉诸竞争压力。
社会适应也不能只要求个人承担变化。企业获得效率收益时,劳动者可能面对技能转换与职业调整。培训、工作转换支持、申诉救济和责任分配,应与应用落地同步推进。只有让更多人能够参与和分享收益,效率提升才会转化为更广泛的社会进步。人工智能应当保持积极、开放的发展方向。支持有益创新,要求具体风险得到相称控制,并检验每项限制的效果与代价,是可以同时坚持的原则。行业有理由持续推进研发与应用,也有责任让每一次能力提升,都更可靠地进入真实生产和生活。







