Token导航 LogoToken导航

昇腾超节点突破算力存储通信三堵墙

更新时间 2026-09-26来源 搜狐科技正文 2656字阅读约 9分钟7 张图片
昇腾超节点突破算力存储通信三堵墙

2026年AI圈最热的词,毫无疑问是智能体(AgenticAI)。AI不再只是聊天、写文案的对话机器人,它能自己拆解任务、调用工具、写代码、循环试错,像一个不知疲倦的数字员工。

智能体持续自主执行任务,带来的直接变化就是Token消耗暴涨,推理需求不再是间歇性的,变成全天候持续负载。十万亿参数的超大模型陆续登场,传统服务器简单堆叠的集群方案,慢慢扛不住这样的压力。上千张算力卡放在一起,很容易卡在通信延迟、内存读写瓶颈上,再多芯片也发挥不出全部实力。

行业里都看好“超节点”这个新形态,把大量算力芯片紧密耦合,实现统一内存管理,让上千张卡协同工作,就像一台计算机。过去一年,不少厂商都发布了超节点产品,但大多停留在样机展示,真正落地商用的案例很少。在华为全联接大会2026上正式上市的昇腾950超节点,成为目前业界规模最大的商用超节点,给智能体时代的算力建设交出一份落地答卷。

一、千卡协同不是简单堆卡,工程与技术双突破

很多人会误以为,超节点就是把几百上千张NPU塞进机柜。但真实落地时,最大难题不是芯片数量,而是怎么让成千上万张卡顺畅对话,打破行业常说的“存储墙”和“通信墙”。

这次上市的昇腾950超节点分为两款产品:面向大型液冷智算中心的Atlas950SuperPoD液冷超节点,以及面向企业普通机房的Atlas850E风冷超节点,覆盖两种完全不同的客户场景。

Atlas950SuperPoD液冷超节点,一套系统集成1024颗高性能NPU,搭配上千套灵衢互联套片和数千个光模块。支撑整套系统稳定运行,本身就是庞大的系统工程。

核心的秘密藏在灵衢高速互联技术。依靠自研统一互联协议,1024颗NPU实现统一内存编址。跨芯片读取内存,体验就和访问本地内存差不多,互联带宽相比上代提升2.1倍,解决大模型训练时频繁跨卡交换数据的痛点。过去开发者需要手动处理数据搬运、格式转换、通信同步,现在这些繁琐工作下沉到硬件层,模型开发的难度大幅降低。

硬件之外,供电、散热、布线这些容易被忽略的工程细节,决定产品能不能稳定长期运行。昇腾自研TPSU电源模块,能储备电能,应对训练推理业务里忽高忽低的用电波动。单颗NPU模组功耗高达950W,依靠高密铲齿搭配冰川铠甲冷板技术,单块冷板可以带走2000W热量。

正交架构设计是另一个巧思,柜内实现全电互联,省去大量线缆。一套1024卡超节点,能节省足足50千米铜线,不仅减少线缆老化故障,还降低信号延迟。柜间光模块用上液冷方案,搭配链路级重传、光模块双保护机制,解决了超节点光模块容易闪断这个行业顽疾。

实际跑模型时,这套系统优势很直观。训练场景,相比传统集群训练效率提升1.5至1.7倍,依靠多层可靠性设计,万卡集群可以做到连续月级稳定训练。推理场景下,吞吐提升2-3倍,延迟可以压到10毫秒以内,支持万亿参数模型训推一体。同时昇腾也是国内唯一商用支持mxFP8低精度训练,并且全流程支持mxFP4推理的厂商。

不少企业已经落地使用。蚂蚁阿福健康模型依托昇腾超节点,做到离线持续调优、在线实时纠偏,AI健康服务响应速度和准确率同步提升;德赛西威搭建算力底座后,训推性能超过传统GPU平台。互联网、运营商、金融、医疗、制造等行业,都已经开始用昇腾超节点搭建智能体应用。

二、风冷超节点降低门槛,普通机房直接部署超节点能力

大型液冷智算中心,建设周期长、改造成本高昂,对中小企业来说门槛太高。很多企业机房还是传统风冷环境,想要接入超节点算力,往往要投入巨资改造基础设施。Atlas850E风冷超节点瞄准了这个痛点。

这款产品依托自研相变散热技术, 不需要改造原有风冷机房,标准机柜就可以直接上架部署,支持32卡到768卡灵活扩展。企业不用推倒重建机房,就能用上超节点架构带来的统一内存、内存池化能力。

智能体多轮对话场景,会反复读写KV缓存,对内存访问延迟要求苛刻。Atlas850E原生支持FP8、mxFP8、HiF8、INT8、mxFP4多种低精度格式,稳定实现10ms级推理延迟。针对万亿MoE模型,它采用异构PD分离方案,根据业务负载动态调配资源,叠加专家并行优化,推理延迟最低到5-10ms,单卡吞吐比普通风冷集群高出2.5倍。

Atlas850E风冷超节点的推出,把超节点技术从大型智算中心带到普通企业机房。中小企业不用承担液冷基建的高额投入,就能低成本搭建智能体推理集群,落地AI编程、企业数字员工这类Agent应用。

三、软件系统是算力大脑,开源生态降低开发者门槛

硬件搭建好高速算力骨架,想要真正释放算力,离不开配套软件系统。如果硬件性能很强,但软件难用、适配麻烦,再强的算力也很难落地。

昇腾超节点配套的系统软件包含灵衢总线管理、灵衢系统服务等组件,支持跨物理节点统一内存编址。编程逻辑和单台机器保持一致,开发者可以直接用Load/Store访问跨卡内存。实测数据显示,1024卡超节点域内集合通信性能提升1.6倍;小包通信场景,耗时从70微秒压缩到8.6微秒,性能提升8倍。

生态层面,昇腾完成CANN和Mind系列全面开源开放,把AI开发从少数专家掌握的技术,变成普通开发者也能上手的工具。目前CANN社区月活开发者突破5200人,在国内开源项目里活跃度名列前茅。从环境部署、算子开发,到大模型训练推理和性能调优,完整工具链覆盖全流程,帮助开发者快速开发智能体应用。

硬件、底层系统软件、开源生态三者配合,让昇腾超节点不再只是一套高性能硬件设备,而是一套完整可用的AI算力解决方案。

四、超节点竞争,比拼的是全栈综合实力

现在超节点赛道热闹,各家厂商不断发布新品,但行业普遍面临一个现实:产品发布会热闹,大规模商用落地案例稀缺。原因很简单,超节点不是单一芯片或者单机柜硬件比拼,而是硬件架构、系统工程、软件生态三位一体的综合考验。

昇腾拿出液冷、风冷两套产品方案,覆盖大型智算中心和企业机房两类场景,解决不同客户的算力需求。一边突破底层互联、散热、供电的硬核技术,一边打磨软件生态,降低开发者使用门槛,把超节点从实验室概念变成可以规模化采购、稳定运行的基础设施。

智能体浪潮刚刚开始,未来会有越来越多AI数字员工进入各行各业,持续消耗海量Token。算力基础设施,也需要跟上AI应用的进化速度。昇腾超节点的规模化商用落地,给十万亿级大模型和AgenticAI时代,树立起国产算力底座的落地样板。算力的竞争,早已不是单卡性能的比拼,谁能搭建稳定易用、全栈协同的算力底座,谁就能抓住智能体时代的新机遇。

文章标签算力芯片
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多