你相信光吗?
以前听到这句灵魂发问,小编想到的大多是奥特曼打小怪兽的热血梗;但谁能想到,2026 年,真有人把“光”玩成了颠覆算力江湖的终极武器。
而这个“人”,就是华为。

9 月 17 日至 19 日,华为全联接大会 2026 在上海世博展览馆及世博中心举行。
要问今年大会最受关注的,无疑是 9 月 17 日主议程上,华为副董事长、轮值董事长汪涛发表的题为“智启新未来,打造智能世界的硅基黑土地”的主题演讲。
以及在演讲中,华为正式发布全球首个采用 NPO 技术的超节点 —— 昇腾 960 超节点,加速十万亿规模大模型的训练和推理。


华为副董事长、轮值董事长汪涛发表主题演讲
5500 个光引擎替代 4.8 万颗光模块,功耗直降 550 千瓦,系统可用度做到 99.8%…… 种种高光技术和亮眼数据,让现场惊呼声不断。
所以,这究竟是一项怎样硬核的创新成果?为什么它又能被视作下一代 AI 基础设施的“终极武器”?
前方高能,建议坐稳。

01.
Agentic AI 倒逼算力重构,超节点成了必答题
先引用汪涛在演讲中说的一句话:
“人工智能也许是人类社会最后一次技术革命,它带来的变革之深、之广、之快,远超想象”。
数据显示,当前大模型参数已快速迈向 10 万亿,到 2030 年预计突破 100 万亿;智能体已经能按小时级连续工作,未来将以“月”为单位执行任务;中国每日推理 Token 已增长到 500 万亿左右,还将迈向百万万亿级。
翻译一下:AI 已经从“聊天搭子”进化成 24 小时待命的“卷王员工”。
更直观的变化是,AI 正从尝鲜式的对话工具,变成能深入千行百业真正干活的 Agentic AI,人工智能从量变走向质变。
但是,质变的另一面却是压力:Agentic AI 时代的算力基础设施,恰好卡在一组核心矛盾上,即一边要支持更大规模的 MoE 模型、更长的上下文序列、更低的推理时延,一边又必须显著降低推理成本。

这是既要马儿跑,又要马儿不吃草啊,还得跑出高铁的速度。

单芯片性能的提升远远跟不上需求,靠简单堆规模的扩展路径,也撞上了边际收益递减的南墙。
瓶颈具体卡在通信上:主流 MoE 模型的训练过程中,数万颗芯片需要对齐每一层、每一个环节的中间结果,华为的仿真显示,10 万卡服务器集群里,芯片间的通信代价超过了全部训练时间的 40%。
10 万张卡,四成时间在“对齐颗粒度”,这开会浓度,职场人看了都沉默。
华为马尔科夫实验室的数据更直观,4K 超节点组成的 10 万卡集群,MFU 比 8 卡服务器组成的同规模集群高出 2.75 倍。
因此,解决之路也更显清晰:让多芯片紧密协同组成“超节点”,对算力基础设施做系统级的架构重构。
这已经成为产业和学界的共识。比如今年 WAIC 期间,鹏城实验室和全球计算联盟牵头发布《超节点定义与实践白皮书》,就把内存统一编址、超低时延、超大带宽写进了行业共识。
一句话:单打独斗没有未来,组团解题才是版本答案。
这条赛道上,华为昇腾超节点是目前国内唯一规模商用的超节点,已规模商用超过 1000 套。

落地互联网、运营商、金融、教育、医疗、交通、制造等行业,也是国内唯一训练出 SOTA 模型的超节点。
之前 WAIC 期间,昇腾 950 超节点(Atlas 950 SuperPoD)的首次真机亮相,就已经引起过广泛关注。
02.
从 950 到 960,超节点把光“请”进了系统
本次全联接大会上,首先是昇腾 950 超节点官宣迈入规模商用的新阶段。不过这只是一道开胃菜。
当汪涛宣布昇腾 960 超节点正式发布时,全场的注意力立刻被重新聚焦:
业界首个采用 NPO 光引擎的超节点,它来了。

- Hi-ONE,把光引擎“贴”到芯片边上
要看懂昇腾 960 超节点,得先认识 Hi-ONE 光引擎。
这是业界首个具备量产能力的 NPO 产品,昇腾 960 超节点“全球首个采用 NPO 技术”的头衔,正是由 Hi-ONE 撑起来的。
两者是一体两面,Hi-ONE 负责打通超节点内部的高速互联,昇腾 960 超节点则是这套技术长成的那台“超级计算机”。

NPO 全称 Near-Packaged Optics,近封装光学,这个读起来有点拗口的技术是用来做什么的呢?
我们知道,今天的大规模 AI 集群内部,主要靠铜缆做电互联,当 Serdes 速率达到 224G 甚至更高,铜缆的各类损耗会让信号传输质量急剧下降。
更麻烦的是,数千根铜缆捆在一起,工程安装困难,维护效率低下。
打个比方,这就像在一条越来越拥挤的老路上跑车,路的名义宽度一直在加,车却越跑越慢,堵在路上的时间越来越长。
业界的解法,是把光引到计算芯片的“最边上”。
NPO 作为与计算芯片近封装的光引擎,可以在距离芯片边缘几厘米的地方完成电信号到光信号的转换,突破铜缆传输距离与带宽的物理极限。
互联功耗与时延显著降低,布线和散热的难题也顺带打包解决。相当于把磁悬浮修到了每个工位门口,通勤效率直接拉满。汪涛说得很直接,“从传统的可插拔模块走向 NPO 是必经之路”。
Hi-ONE 的底气来自三个“第一”:
- 它是业界首个量产的 NPO 产品;
- 是行业目前传输能力最大的 NPO 产品,单引擎容量 7.2T,相当于把 36 个 200G 的 Lane 集成进一个模块,一小块 Hi-ONE 就能顶替 9 颗 800G 光模块;
- 还是唯一实现内置光源的 NPO 产品,把高带宽、高可靠与低时延、低功耗揉在了一起。
均衡设计的背后,是华为 30 多年光技术的积累。

汪涛在圆桌专访中引用了任正非经常说的一句话,华为的研发投资是“范弗利特弹药量,打破一个城墙口”。
几十年攒下的光通信家底,集中砸向超节点互联这个城墙口,Hi-ONE 就是砸出来的结果。它与灵衢协议一起,构成了可规模扩展的超节点互联系统,华为还在全球光互联标准组织 OIF 提出了 NPO 标准立项建议,得到众多行业伙伴的积极响应。
而这套互联系统服务的“心脏”,是昇腾 960 芯片。
华为在会上宣布,昇腾 960 芯片研发进度超出预期,性能实现倍增。960DT 比原计划提前三个季度,2027 年第一季度就绪;960PR 比原计划提前一个季度,2027 年第三季度就绪。

往后看,昇腾系列芯片将保持一年一代的演进节奏,2028 年、2029 年陆续推出昇腾 970、980,算力规格继续翻倍。
- 4096 卡“一台计算机”,可靠性和规模一样值钱
芯片与互联打底,昇腾 960 超节点的整体规格便水到渠成。
它采用领先的正交架构和全液冷设计,基于灵衢实现内存统一编址,可扩展至 4096 卡规模,提供 8EFLOPS FP8、16EFLOPS FP4 的算力,HBM 容量高达 1PB。
按照超节点白皮书定义,内存统一编址意味着:超节点内部任意一块芯片,都可以访问公共内存池。四千多张加速卡,逻辑上合并成为一台巨型计算机。刚好匹配十万亿参数大模型训练推理需求。
最让人吃惊的是硬件成本与功耗优化。
5500 个 Hi‑ONE 光引擎,直接替代原本需要的 48000 颗 800G 光模块。整机功耗直接减少 550 千瓦,无故障运行时间翻倍,系统可用度高达 99.8%。
很多人看 AI 集群,只盯着算力纸面参数,却忽略可靠性这个隐藏“吞金兽”。
汪涛在大会的圆桌专访中也透露,业界 10 万卡集群的 MFU 往往连 30% 都不到,意味着大量时间耗在故障和故障修复上;MFU 每提升 1 个百分点,10T 大模型的训练就能缩短三天。对动辄数月的大模型训练来说,可靠性就是实打实的时间和成本。
汪涛对此看得很清醒,“要提供有竞争力的训练和推理系统,只做好一个芯片不够,只做一个整机和服务器也是不够的”,最终考验的是多学科的系统工程能力。

此外值得一提的是,除了昇腾 960 超节点,在会上华为还展现了超节点架构的更大版图。
包括鲲鹏超节点全新升级,基于灵衢全光组网最大支持 4096 节点,形成 256TB 统一内存池,十万级沙箱启动速度比传统服务器方案提升 30 倍,沙箱密度还能再提升 25%,Agent 向量检索效率实现倍增。
同时,面向 Agent 推理系统,华为推出基于灵衢 UnifiedBus、支持“一跳直连”的 L3.5 层 PB 级 KV 缓存方案 OceanStor M900 集群,用混合介质加优化 Retention 算法,把 SSD 读写寿命提升 16 倍。
多个昇腾 960 超节点通过灵衢网络或 RoCE 连接,二层 CLOS 四平面组网下最大集群规模可达 51.2 万卡,再结合多轨道拓扑技术,最大可支持 100 万卡昇腾超节点集群。
算力的规模天花板,又被抬高了一截。
03.
别把昇腾 960 的价值想简单了
看完硬件参数,相信大家已经感受到昇腾 960 超节点的冲击力。但它的意义,远不止一台性能强悍的机器。
- 第一,走出不靠堆工艺的算力升级路径。
当下芯片工艺的前进脚步越来越难。昇腾给出一条新思路:靠超节点 + 集群架构创新,拔高算力上限。

从昇腾 901C 到 950,再到本次发布的 960;规模从 384 卡、 1024 卡迈向 4096 卡,同步持续拉高 MFU 利用率。
算力升级不必死磕芯片制程,架构、互联、散热、可靠性,整套系统工程同样大有可为。
这套完整方法论,整个行业都可以借鉴复用。
- 其次,它把 NPO 从技术构想推向了产业现实。
此前 NPO 更多停留在实验室和论文里,Hi-ONE 作为业界首个量产的 NPO 产品落地,加上华为在 OIF 推动标准立项,意味着光电融合的互联技术开始进入产业化阶段。
对光模块厂商、设备商和数据中心建设者来说,这是一个明确的风向标 —— 下一代 AI 基础设施的互联形态,正在被重新定义。

- 最后,强悍硬件,还需要开放生态放大价值。
汪涛反复强调,华为专注筑牢 AI 基础设施底座,坚持开源开放算力生态,拥抱国内百模千态的发展浪潮。
CANN 已经全面开源常态化运营。社区外部开发者占比达到 61%,首次超过内部研发人员。月活跃开发者突破 5200 人,成长为国内活跃度顶尖的 AI 开源社区。
昇腾已经适配 90 多个主流第三方开源社区,并且在 Linux 基金会支持下,正式登上 PyTorch 官网可直接安装的算力平台。这也是第一个登上 PyTorch 官网的中国算力平台。
再加上鲲鹏生态 416 万全球开发者,7200 余家合作伙伴,昇腾联合伙伴孵化 7000 多套行业解决方案。
开放,让算力底座从单一企业产品,变成全产业可以共享使用的公共基础资源。

04.
结语:把 AI 变成触手可及的生产力
回到汪涛演讲的题目,“打造智能世界的硅基黑土地”。黑土地自己不直接长出庄稼,它的价值在于让每一位耕种者都能有所收获。
华为选择磨好自己的“豆腐”,做好算力底座,把根技术做深,把生态做开。
“没有任何一家公司能独自支撑整个智能世界。”
AI 时代的大幕才刚刚拉开。接下来,华为将和合作伙伴一起,助力客户把 AI 转化为每个行业、每个企业触手可及的生产力。对千行万业来说,这或许才是“硅基黑土地”最实实在在的许诺。

毕竟,选择相信光的人,运气不会太差 ~








