semianalysis 最近更新的两篇 EDA 分析我们都没写,主要是 EDA 这个赛道过于小众,很多读者都不太熟悉,而且 EDA 的市场也太小,很难成为AI 赛道的主力焦点。
笔者之前就是在某外资 EDA 企业,全球龙头 Synopsys 的市场也才 1000 亿美元,跟动辄万亿美元的 CSP 和 AI 硬件公司来说,都是没法比的。
而且全球的 EDA 公司也并不是非常多,但根据关老师的统计(半导体综研),中国就有 100 多家 EDA 公司,几乎每个细分赛道都有几个玩家,可谓是卷出来了新的高度。
这篇文章是 SemiAnalysis 今天发的 HVDC 的分析,这个话题绝对是AI 赛道的焦点之一,所以我们就看下 SA 的这个文章。这个只是 SA 的 Part1,后续应该还有会更新。

当 GPU 集群变得越来越密集,Kyber Ultra 单机架功率接近660kW 时,物理定律开始显现它的限制。电阻损耗与电流的平方成正比,在这种功率水平下,铜的质量和散热需求已经超出了机架能容纳的范围。

传统的数据中心电气架构依赖设施级的交流配电。今天的数据中心使用415V 或480V 的三相交流电,拓扑结构依赖传统的 UPS 架构,然后在机架内分配48-54V 直流电。这套系统在当前的机架功率水平下尚可运行,但随着未来两年机架密度接近600kW 以上,问题开始暴露:
铜变得难以管理。 一个1MW 机架在48-54VDC 下需要约200公斤铜母线。在1GW 规模下,这意味着数百吨铜——成本、重量、安装复杂度和布线空间都成为沉重负担。
电源货架挤占计算空间。 今天的 NVL72机架已经使用多达8个电源货架。在 Kyber 级别的机架功率下,48-54V 方案需要约64U 当量的电源硬件,实际上相当于整个机架,几乎没有空间留给计算设备。
电流成为真正的限制因素。 提供600kW 功率在48-54V 下意味着约12,500A 电流。在800V 下,这降至约750A(减少约16.7倍),使得导体/母线可以大幅缩小,热应力也大幅降低。如果保持导体电阻不变,I²R 损耗下降约278倍,因此实际中可以缩小铜的用量,“购买”尺寸和重量的减少。
转换损耗累积并损害可靠性。 堆叠的 AC-to-DC 和 DC-to-DC 级降低端到端效率,增加热量,引入故障点,提高冷却负载、停机风险和维护成本。
归根结底,800VDC 是实现2,300W TDP 芯片和600kW 机架的物理使能器,而这些600kW 机架是追求密度的直接结果。密度驱动每 token 成本下降。每 token 成本由能在全 NVLink 带宽下构建的 scale-up 世界的大小决定:更大的域意味着更宽的专家并行(EP)/张量并行(TP),MoE 路由在 NVLink 而非 scale-out 上进行,解码过程中的序列化更少。

正如 Nvidia 的设计规则所示,计算要紧密打包到铜能够触及机架内所有设备的程度。单个机架限定了可以构建的专家层的大小,因为一旦 all-to-all 跨越机架边界,它就落到 scale-out fabric 上,速度大约比 NVLink 慢八倍。更大的 scale-up 世界意味着更密集的机架,更密集的机架意味着600kW 封装,而800VDC 正是使这些封装成为可能的技术。
从改造到重构:四步走战略
向800VDC 的转型是一场复杂的蜕变,它重写了整个电气架构,引入了新的安全标准,需要新的监管框架,最重要的是,迫使运营商在何时放弃传统 AC 配电方面做出非常不同的战略选择。

这个转型可以分为四个清晰的阶段。第1和第2阶段从2026年底/2027年初开始,通过电源机架将现有 AC 配电改造为机架级的800VDC。第3阶段重写电气架构本身,将800VDC 配电扩展到整个设施。第4阶段是终极状态,围绕新设备构建,承诺让今天的大部分电气设备栈变得过时。

Phase 1(2026-2027):小心翼翼的试水
这场 HVDC 之旅主要从两个运营商开始:Google 和 Meta。两家公司在过去18个月中一直通过 OCP 工作组推动他们的800VDC 架构,最明显的是 Mt. Diablo 参考设计,于2024年10月首次宣布,并于2025年5月作为开放规范发布。两家都不是被迫进行转型,而是为了在即将到来的转变中占据领先地位,因为他们想在市场其他部分被迫追赶之前,从现有电源链中挤出每一兆瓦和每一个效率点。
这很重要,因为800VDC 还不是硬性要求。2026年底和2027年推出的芯片代,如 Vera Rubin NVL72,机架密度最高达到180-220kW。三相交流电仍然可以提供这种功率,而不会触及导体尺寸或配电损耗的物理极限。因此,第1阶段是自愿的未来验证,而不是对硬件约束的被迫响应。
这个初始阶段开启了“白空间改造”时代。新的 HVDC 硬件,主要是称为 HVDC 电源机架的行级机柜,叠加在现有白空间基础设施之上,而不是替换它。数据中心的电气骨干保持完整。相同的变压器、相同的 UPS、相同的开关设备、相同的 ATS。
在设施层面,中压交流电进入灰色空间,通过变压器降压至415V 或480V 三相交流电。然后馈入 UPS,执行双转换(AC-DC-AC),然后输出415V 交流电。交流电然后通过母线槽分配到数据大厅。到目前为止,这是我们在以前文章中广泛介绍的传统电源流。
变化发生在我们接近 IT 机架时。415V 不再直接馈入机架内电源单元,而是终止于部署在行级的独立42U 机柜,称为 HVDC 电源机架。

机架从架空母线槽接收交流电,并通过电缆向相邻 IT 机架输出800VDC。在内部,它执行三项工作:将415V 交流电整流为800VDC,BBU 模块用于断电期间的过渡,以及可选的电容器货架用于 GPU 负载峰值期间的瞬态缓冲。

HVDC 电源机架是早期改造阶段的主要新设备成本。估计电源机架的平均售价达到每台40-50万美元,大约是标准交流电源机架设备约4万美元平均售价的10倍。按部署 MW 计算,约为50万美元/MW。
白空间改造代表了与当前架构相比,电气内容/MW 的明确成本上升,因为第1阶段基本上没有删除任何东西。估计增量约为+40-50万美元/MW,HVDC 电源机架占大部分。
Phase 2(2027-2028):物理强制的转折点
第1阶段是改造时代的开始。真正的拐点来自800VDC 原生系统的到来。此时,800VDC 不再是未来验证试点,而成为物理和机架密度强制的必要转型。为 Kyber 机架供电的运营商在机架入口处没有交流电回退选项,预计800VDC 渗透率将在这个窗口急剧上升。因为800VDC 原生硅将在设施级800VDC 配电准备就绪之前到来,改造阶段持续存在。
在架构上,第2阶段看起来与第1阶段非常相似。两者都用 HVDC 电源机架改造白空间,都保持灰色空间完整,都在行级电源机架中将交流电整流为直流电。关键区别在于电压降至芯片可用水平的位置。在第1阶段(Oberon 机架)中,IT 机架内的电源货架在到达计算托盘之前将800VDC 转换为约50VDC。在第2阶段(Kyber 机架)中,800VDC 总线直接运行到计算刀片,板载电源模块处理最终降压至50V。
因为大多数服务器和托盘仍然采用约50V 输入,两种架构都保留了高功率800V 到约50V 的 DC-DC 转换级。区别在于转换发生的位置。
一些讨论探索了将800VDC 直接送入计算托盘并在进一步转换为负载点轨道之前降至中间总线电压(IBV)的可能性。虽然 Kyber 的板载电源模块确实接受800V 输入,但它转换为已建立的约50V 总线电平,而不是 IBV 方案。考虑到涉及的有限空间和安全约束,托盘内的完整800V-to-IBV-to-PoL 架构仍然极具挑战性。
Phase 3(2028-2029后期):系统性重构电气架构
在第1和第2阶段,AC-DC 转换发生在靠近机架的地方,在行级 HVDC 电源机架内。第3阶段改变了数据中心布局本身,800VDC 成为建筑的电气核心。这是真正的拐点,事情开始变得有趣。
在第3阶段,位于灰色空间或室外的专用上游整流器将415V 交流电转换为800VDC,在整个大厅分配直流电。这些是使用硅 IGBT 或晶闸管的成熟单元,额定电压为1200-1700V。
灰色空间一分为二。将数据中心连接到电网的中压变压器保持不变。中压开关设备保留,因为公用事业馈电仍然是交流电,随着设施扩展到千兆瓦集群,预计上游中压基础设施(11-34kV)将变得更加复杂。低压变压器保留,将中压降至415V 交流电供上游整流器使用。低压变压器和 PDU 之间的480V 交流开关设备在800VDC 流经母线槽后就没有作用了,交流楼层 PDU 也随之被淘汰,因为直流母线槽直接向电池机架供电,中间没有交流配电 PDU。总之,交流-直流转换点以上的一切都保留,而以下为交流配电设计的一切都消失。
在第3阶段,交流配电板将一个馈电分成多个受保护输出的功能必须落在某个地方。三类产品定位于吸收它:(i)具有多个输出和每个输出集成 SSCB 保护的兆瓦级整流器,将整流器变成自己的配电设备;(ii)带有配备断路器的分接箱的直流母线槽,一旦具有足够电弧中断能力的直流额定分接箱成熟,就在配电介质中保持保护;(iii)预制灰色空间舱,将整流器、配电板和母线槽捆绑到工厂建造的撬装设备中,特别是用于超大规模采购。
在白空间,800VDC 通过母线槽或电缆分配到行。电源机架简化为电池机架,因为 AC-DC 整流现在发生在上游。机架仍然容纳 BBU 和超级电容器,但不再需要 PSU 货架。这释放了机架空间,降低了行级设备的复杂性,并将热负荷从白空间转移到灰色空间或室外整流器位置。
Phase 4:固态变压器的终极形态
第4阶段是终极状态,围绕一种新设备构建,承诺让今天的大部分电气设备栈变得过时:固态变压器(SST)。
SST 直接从中压交流电(11-34kV)转换为800VDC,跳过低压变压器和整流器。它使用基于宽禁带半导体(SiC 或 GaN)的高频变压器,在比传统铁芯变压器高得多的频率(20-100kHz vs 50-60Hz)下运行。更高的频率允许更小、更轻的磁性元件,更高的功率密度,以及更精细的控制。
SST 还集成了保护、功率因数校正和谐波滤波,功能上合并了今天需要单独设备的多个阶段。它可以提供双向功率流,这对于与电池储能系统(BESS)或现场发电集成至关重要。
但 SST 仍然是一个新兴类别。半导体成本高,热管理具有挑战性,现场可靠性数据有限。主要供应商包括 DG Matrix、Novos Power 和 Aran Industries,但大规模部署可能要到2029-2030年才会发生。
到2030年,预计 SST TAM 将达到约130亿美元,捕获从 sidecar 层转移的需求以及增量的 MV-to-800VDC 转换。我们考虑每 MW 约125万美元的内容。这个机会的一部分由中压整流器争夺,但我们预计 SST 将占据大部分份额。
标准之争:OCP Diablo 400的诞生
Diablo 400规范(以 Microsoft 最初的内部项目名称 Mt Diablo 命名)正式化并标准化了 HPR V4开创的 HVDC sidecar 概念。由 Google、Meta 和 Microsoft 联合撰写,Diablo 400于2025年5月作为草案规范(v0.5.2)发布,随后根据行业反馈发布了 v0.7.0修订版。
Diablo 400标准化了 HPR V4没有的内容:
多供应商互操作性。 标准化的电气和机械接口,使得来自 Delta 的 PSU 货架、来自 Advanced Energy 的电源管理、来自 TE Connectivity 的母线和来自多个供应商的 BBU 都可以在单个机架中协同工作。
双电压支持。 基本规范将±400VDC 双极定义为标准配置(3线:+400V、-400V 和整流器货架输出处的公共/中点/回路),800VDC 单极作为明确的设计选项(2线:800VDC 和回路,与 PE 地安全隔离)。
功率范围。 每 IT 机架100kW 至1MW。
选择400VDC 作为标称电压是经过深思熟虑的。正如 Google 的工程师在2025年 OCP EMEA 上所说:“选择400VDC 作为标称电压使我们能够利用电动汽车建立的供应链,以获得更大的规模经济、更高效的制造以及改进的质量和规模。”在双极配置中,每条独立轨道距离接地中点仅400V,使系统保持在成熟的 EV 级功率电子器件(650V GaN FET、400V 级电容器、连接器和保险丝)可以直接使用的电压范围内。
但现实是碎片化的。没有一刀切的800VDC 电源机架。是的,Diablo 400提供了共享的基础规范,但实际情况是分散的。Nvidia 完全置身事外,正在开发660kW 的单极800V 参考设计,风冷样品和生产在2026年中期,液冷 VR Ultra 变体在2026年底采样。
即使在 Diablo 400内部,三位联合作者也有显著分歧。Meta 运行600-800kW,配有50kW HVDC 输出电缆和8x 200A 交流输入鞭。Google 通过将机架空间从 BBU 和超级电容器插槽重新分配给 PSU 推至900kW,运行100kW 输出电缆,在1.1MW 上限需要12根交流鞭。Amazon 的设计落在800kW 的±400V 上。Microsoft 联合撰写了规范,但我们认为他们的进展较慢。
此外,另一种 sidecar 拓扑使用低压输入 SST 代替传统整流器加 PSU 堆栈,如 DG Matrix 的 Interport Cell 系列。
传统 UPS 的黄昏
传统的集中式 UPS 系统可能是800VDC 转型中最具争议的基础设施。在800VDC 架构中,预计集中式低压 UPS 系统将逐步失去作用并最终变得过时。
在改造时代,电源机架直接位于800VDC 总线上,并容纳 BBU 模块和超级电容器。两者都是原生直流耦合的。BBU 在断电期间桥接几秒到几分钟,超级电容器吸收毫秒级 GPU 负载瞬态。它们共同取代了集中式短期电池存储和 UPS 过渡功能,而没有 AC-DC-AC UPS 对的2-3%转换损耗。
Google 和 Meta 多年前就已经采取了这种激进方法,用“分布式 UPS”架构绕过中央整体式 UPS。在他们的架构中,交流电直接分配到机架,机架内 PSU 处理 AC-DC 转换,机架级锂离子电池备份单元(BBU)提供短时桥接电源。这消除了中央 UPS 的 AC-DC-AC 转换对并提高了效率,同时还将数据中心所需的总电池容量减半,因为不再需要 A 侧和 B 侧 UPS。
也就是说,管理分布式 UPS 或电池备份在运营上比运行传统中央 UPS 更具挑战性。预计除 Google 和 Meta 等垂直整合的超大规模运营商之外的运营商将在中期内保留低压 UPS 以实现冗余和负载波动管理。
这对于托管提供商尤其如此,他们优先考虑灵活性,需要支持混合工作负载:CPU 机架、存储阵列、网络设备和仍在交流电上运行的旧 GPU 机架。保持灰色空间交流基础设施完整使这些运营商能够为最密集的 AI 机架部署800VDC,同时为其他所有设备运行标准交流配电。
新的替代方案正在出现。中压 UPS,直接在电网连接点运行在4.16-34.5kV,在功能上类似于机架级电池机架,但集中在电网接口而不是分布在数据大厅。ABB 的 HiPerGuard 运行效率为98%,已经部署在 Applied Digital 位于北达科他州的400MW AI 园区。ON.energy 几周前获得了一项美国专利,保护其中压双转换 UPS 架构。第二种替代方案是设施级 BESS,其运行规模为兆瓦到数百兆瓦,提供1-4小时持续时间备份,并越来越多地替换或缩小柴油发电机。
供应链的大洗牌
800VDC 革命将极大地改变某些供应商的收入轨迹。预计 sidecar TAM 将在2028年达到约110亿美元的峰值,然后随着设施级800VDC 在第3阶段占据份额而下降。到2030年,800VDC 供电的总增量容量将达到约39GW。
新兴赢家包括电源机架制造商(Delta、Advanced Energy、Murata 等),他们从 PSU 货架、BBU 模块和电源管理系统中获得内容。SST 创新者(DG Matrix、Novos Power、Aran Industries)定位于在第4阶段捕获高价值转换级。宽禁带半导体供应商(Wolfspeed、Infineon、Onsemi)从 SiC 和 GaN FET 内容增加中受益。DC 配电设备供应商(EPEC Solutions、Sensata、TE Connectivity)从 DC 母线槽、断路器和连接器中获得份额。
转型挑战者面临业务模式压力。传统 UPS 供应商(Schneider Electric、Eaton、Vertiv)看到集中式低压 UPS 市场萎缩,必须转向中压 UPS、分布式 BBU 或设施级 BESS。交流开关设备和 PDU 供应商看到灰色空间内容被淘汰,必须开发 DC 额定替代品或转向上游中压设备。传统电气巨头(ABB、Siemens)需要重新定位产品组合,从交流配电转向 DC 配电和 SST。
成本与效率:数字背后的真相
总电气内容每 MW 在我们建模的五种架构中的四种中保持在360-480万美元的范围内。主要标题是内容从灰色空间迁移到白空间,以及由此产生的设备组合变化。灰色空间内容在第2阶段缩小,因为集中式 UPS(120万美元)退出。白空间在第1阶段达到峰值,因为 HVDC 电源机架到来。到第4阶段,总内容攀升至400万美元,因为 SST 取代了低压变压器和整流器。
我们计算基线交流电源路径在七个转换级中的累积效率为82.0%。VRM(92%)和 PSU(94%)是两个最大的单级损耗。VRM 在每种架构中都保留,但 PSU 的损耗是800VDC 转型可以消除的最大惩罚。第1阶段几乎没有改善,估计为83.7%。UPS 双转换回路仍然消耗3个百分点,新的电源机架整流器(97.5%)加上 DC-DC 级(97.0%)仅略微优于旧的单级 PSU。
真正的跳跃来自第2阶段(86.5%),当时 UPS 消除将链从七级减少到五级。第3阶段推至86.9%,因为集中式灰色空间整流器在兆瓦规模下运行(效率高于模块化机架安装单元),800VDC 大厅级配电消除了交流集肤效应和无功功率损耗。我们估计第4阶段达到87.4%,因为 SST 用单个设备替换两个级。
在1GW 的 IT 负载下,第2阶段的增益转化为约58MW 的连续电网功率节省。第3阶段将其扩展到63MW,第4阶段扩展到69MW。Nvidia 引用高达5%的效率改进,意味着在1GW 下约50MW。我们的第4阶段效率增量计算的5%与基线匹配 Nvidia 报告的数字。
挑战与风险
革命不会一帆风顺。800VDC 转型面临多个挑战:
安全标准的空白。 800VDC 需要新的监管框架和安全规范。虽然欧盟低压指令范围参考高达1,500V DC 的直流设备额定值,但数据中心特定的800VDC 标准仍在制定中。电弧闪光风险、接触保护、接地方案和故障检测都需要新的协议。
DC 断路器的技术难题。 直流电弧比交流电弧更难中断,因为没有自然的过零点。高中断容量 DC 断路器需要主动电弧熄灭技术(固态断路器、混合断路器或磁吹断路器),这些技术比传统交流断路器更昂贵且更复杂。
运营复杂度。 分布式电池管理比集中式 UPS 更具挑战性。运营商必须监控和维护数百或数千个机架级 BBU 模块,而不是少数几个中央 UPS 系统。故障域更小,但故障点更多。
过渡期的两难。 在第1和第2阶段,运营商同时运行交流和直流配电,增加了复杂性和成本。在第3阶段,他们必须决定何时淘汰传统交流基础设施,这是一个涉及资本支出、运营风险和工作负载组合的艰难决定。
供应链成熟度。 虽然从电动汽车产业借鉴成熟的功率电子器件有所帮助,但数据中心级功率水平(数百千瓦到兆瓦)需要不同的封装、热管理和可靠性标准。供应链需要时间来扩大规模并证明现场可靠性。
历史的回响
每一次架构转变最初都显得过度。运营商花了几十年时间把水挡在数据大厅外,然后 GPU 热密度使得将冷却液直接运行到珍贵的硅片旁边变得不可避免。每一次转变无论如何都会发生,因为物理学和计算经济学不会谈判。
800VDC 是下一个。从液冷到800VDC,模式是相同的:最初的怀疑,然后是早期采用者的试点,然后是物理强制的拐点,最后是行业范围的转型。区别在于时间表和谁首先移动。
Google 和 Meta 正在引领,因为他们可以吸收早期采用的成本并从效率收益中获益。Nvidia 正在推动,因为他们的硅路线图需要它。其他超大规模运营商和托管提供商将紧随其后,不是因为他们想要,而是因为物理学不给他们选择。
站在电力革命的前夜
2026-2030年是一个五年窗口期,将定义下一个十年的数据中心基础设施。对于数据中心运营商,问题不是是否转向800VDC,而是何时以及如何转向。提前规划意味着在第1阶段锁定供应商关系和工程专业知识。观望意味着在第2阶段被迫快速移动,当时800VDC 原生硅到来,供应链紧张,溢价高。
对于设备供应商,问题是转型还是出局。传统 UPS 和交流配电供应商必须开发新产品或面临市场份额侵蚀。电源机架、SST 和 DC 配电供应商有一个窗口来建立市场地位。宽禁带半导体供应商有机会从内容增加中获益。
对于投资者,问题是谁是下一个十年的赢家。电源机架市场将在2028年达到110亿美元峰值,然后随着 SST 在2029-2030年占据份额而下降。到2030年,39GW 的800VDC 容量代表数百亿美元的设备更新市场。早期识别赢家和输家需要对技术路线图、供应链定位和运营商采用时间表的深入理解。
最终的思考是:800VDC 只是开始。AI 基础设施的进化永不停歇。下一个前沿可能是更高的电压(1,200V 或1,500V),更高的功率密度(1MW+机架),或完全不同的架构(光互连、片上电源转换、无线电力传输)。物理学和经济学将继续推动,运营商将继续适应,供应链将继续进化。
唯一确定的是:计算密度将继续增长,每 token 成本将继续下降,基础设施将继续转型以使其成为可能。800VDC 是这个旅程的下一步,而不是最后一步。
知识星球
对半导体和AI产业交流,可以加下面微信,请备注姓名和所在行业。







