近几个月来,人工智能推理加速器领域出现了一个明显的趋势。多家公司已在其发展路线图中暗示,将DRAM和计算能力堆叠起来。
高通发布了HBC (高带宽计算)技术,随后在Hot Chips大会上,Cerebras表示CS-6芯片将在其计算芯片上堆叠DRAM芯片。三星一直在不遗余力地推广其zHBM技术,并将其称为最终目标。有传言称,Groq LP40也在考虑采用堆叠式DRAM。此外,d-Matrix在深度大会上展示了其第二代加速器Raptor,该加速器也采用了堆叠式DRAM ,并宣布与NVIDIA建立合作关系。
在本文中,我将阐述这一趋势的合理性。我将深入探讨三个具体原因。
1、3D DRAM 可实现性能最高的架构
2、3D DRAM 可将功耗降低至 0.1 pJ/bit 以下,从而释放出更多功率预算用于计算和网络通信。
3、与HBM不同,3D DRAM的访问可以像SRAM一样实现确定性。

3D DRAM 能够实现最佳、性能最高的架构
今年英伟达GTC大会上最精彩的环节莫过于两位科技界巨擘——英伟达首席科学家Bill Dally 和谷歌DeepMind前首席科学家Jeff Dean——之间的炉边谈话。他们二人对现代计算的贡献功不可没。在他们探讨的众多话题中,有一个观点始终萦绕在他们心头——处理计算最节能、性能最高的方法是将数据放在张量引擎旁边,尽量不要移动它。
“通常情况下,对 NVFP4 进行乘加运算需要 10 飞焦耳的能量,而从 HBM4 读取这 4 位数据(每位耗能 3-4 皮焦耳)则需要大约 15 皮焦耳。这意味着从外部存储器读取一个 NVFP4 数值所需的能量是进行乘加运算的 1000 倍。但是,读取 SRAM 也只需要大约 10 飞焦耳的能量。降低能耗的关键在于避免数据传输。”Billy Dally,GTC 2026
这基本上就是 Groq、Cerebras 和 d-Matrix 等加速器背后的架构理念,即 SRAM 与计算单元位于同一位置。但是,尽管 SRAM 在带宽、延迟和每比特能耗方面明显优于 DRAM,但其容量很快就会耗尽。3D DRAM 是实现下一阶段飞跃的唯一途径,它既能保持与 SRAM 相近的带宽,又能将容量提升一个数量级。
与基于 SRAM 的架构类似,在 3D DRAM 中,每个张量核心都可以拥有自己的专用内存块,并通过专用线路进行读写操作。这种容量和带宽完全属于该张量核心,这与 HBM 不同,HBM 的内存通常被视为一个统一的池,所有张量核心共享同一内存。
Jeff Dean 将这种在计算端采用堆叠式 DRAM 的理想架构比作一台弹珠机。你打开闸门,数据就会像滚雪球一样落到专用的张量核心。
现在,让我们仔细看看d-Matrix在Hot Chips大会上展出的Raptor加速器。它是首款公开了大量细节信息的3D DRAM加速器。
封装架构:每个 Raptor 封装包含 4 个芯片。
芯粒设计:该封装中的每个小芯片都是“三明治”结构,由一个计算芯片和一个堆叠的DRAM芯片组成。
计算布局:每个芯片有 256 个张量引擎,每个引擎分配有 3 个专用 DRAM 存储体,并有专用线路进行读写操作。
互连:每个DRAM存储体都有一条256位总线。也就是说,在单个芯片上,计算单元和内存单元之间有196K条数据通道。因此,每个张量引擎都有一条768位总线连接到其专用DRAM。
One Raptor Chiplet = 256 Tensor Cores x 3 banks x 256 bit-bus/bank = 196K data lanes
One Raptor Package =4 chiplets x 196K = ~800K data lates
相比之下,Blackwell封装的GPU 与其 8 个 HBM3E 堆栈之间只有 8K 条数据通道,而Rubin封装的 8 个 HBM4 堆栈也只有 16K 条数据通道。
通道数量增加一个数量级的优势在于,你可以让每条通道以较低的频率运行,大约在 500-700 MHz 左右,而无需像 HBM4 那样,每引脚 11 Gbps 以上的带宽以及由此带来的信号完整性/性能完整性 (SI/PI) 和设计复杂性。以如此低的频率运行 196K 条通道还有另一个巨大的优势,我们将在下一节中详细介绍。


至于数字方面,
1、d-Matrix 宣称其性能基于每对芯片(8 个芯片组),如下图所示。这对芯片可提供超过 100 TB/s 的内存带宽;
2、与第一代 Corsair 加速卡的 2GB SRAM 相比,Raptor 将配备 32GB 堆叠式 DRAM;
3、在机架层面,18 个计算托架,每个托架配备 8 个 Raptor 封装,总共可提供 2.3TB 的 3D-DRAM 容量和 7.2 PB/s 的内存带宽。相比之下,配备 72 个 Rubin GPU 的 NVL 机架的 HBM4 带宽为 1.6 PB/s;
而这仅仅是第一代基于 3D-DRAM 的加速器。

关键在于:多家公司已详细阐述了基于SRAM的推理加速器的优势。从发展路线图来看,3D DRAM是实现下一步飞跃的唯一途径,它既能保持与SRAM类似的带宽,又能提升容量。
3D DRAM 可将功耗降低至 < 0.1 pJ/bit
功耗角度其实很容易理解。
在HBM中,DRAM阵列本身的能耗并非问题所在。真正的问题在于通过中介层在内存堆栈和计算芯片之间传输数据。克服如此大的电容需要大功率驱动器,而且路径上的每一段都会增加能耗——数据横向穿过HBM基片到达凸点,向下穿过中介层,再向上到达计算芯片的凸点,然后再次横向穿过计算芯片到达目标位置。所有这些步骤加起来,每比特的能耗约为2.5 pJ。

当DRAM直接堆叠在计算芯片上时,很容易想象数据从DRAM位单元到计算执行点之间的传输距离有多么短。这样就完全省去了中介层,功耗降至0.35-0.4 pJ/bit。
为了更直观地理解 2.5 pJ/bit 与 0.4 pJ/bit 的区别,我们可以将其乘以带宽,换算成瓦特。从 HBM 堆栈中提取 100 TB/s 的数据需要 2000W 的功耗,而从 3D DRAM 中提取则需要 296W。请仔细想想,从 HBM 中提取 100 TB/s 的数据所需的功耗比从 3D DRAM 中提取高出一个数量级。下文将详细介绍这些数字的推导过程。
HBM power for 100TB/s = 2.5 pJ/bit x 100 TB/s x 8 bits = 2000W
3DD power for 100TB/s = 0.37 pJ/bit x 100 TB/s x 8 bits = 296W
在三星的 zHBM 展示中也能看到这一点。他们论证了在 1200W GPU 系统中,zHBM 节省下来的功耗可以用于提升计算能力。


但关键在于,0.37 pJ/bit 并不是最低值。
Raptor采用36微米间距的微凸点将两颗芯片键合在一起。在如此小的焊盘旁边,一个4纳米晶体管驱动器显得非常微小,而焊盘、其静电放电保护以及通往焊盘的布线,按照片上标准来看,构成了一个较大的电容。DRAM侧的情况也类似。
混合键合技术显著缩小了芯片尺寸。引脚间距从 36 微米减小到个位数微米,焊盘尺寸也随之缩小。计算芯片中的驱动器与 DRAM 之间的布线距离大大缩短,电容也随之降低。因此,能耗进一步从约 0.4 pJ/bit 降至约 0.1 pJ/bit。

3D DRAM的确定性
好的,我推销的最后一部分是——DRAM 因其不确定性而臭名昭著。
HBM、LPDDR 和类似的存储器在启动时会经历一个称为训练和校准的初始化过程。在这个过程中,计算芯片上的 HBM PHY 会运行读取中心化和写入中心化算法。它会将预先设定的模式写入存储器,然后读取这些模式,并扫描每条通道上的相位旋转器,以找到数据眼的中心。我在这里对这个过程进行了简化描述。如果您感兴趣,我在其他文章中详细介绍了其中的细节。
训练只是开始。启动后,有三件事会导致DRAM处于不确定状态。
1、电压和温度的变化会导致最佳眼图发生漂移,因此PHY需要定期重新校准。这是不确定性的来源之一。
2、刷新过程由温度控制。这是一项必要操作,但会直接降低性能。
3、DRAM 对数据的存储和检索方式非常敏感。由于 HBM 通常被视为统一内存,HBM 控制器会重新排序事务以最大化页面命中率和存储体轮换。这使得任何读取请求的延迟都具有不确定性。
对于 3D DRAM 而言,这些问题要么不适用,要么很容易通过设计来解决。
1、当DRAM直接与计算芯片绑定时,由于距离极短,无需传统的HBM式PHY。这样就无需进行训练和校准,也无需考虑走线长度。计算芯片和内存芯片之间的接口通过静态时序分析实现闭合,因此这种设计有时被称为无PHY设计。
2、在 3D DRAM 中,每个存储体都很浅,因此我们可以将刷新率设置为足够高的频率,而不会对性能造成太大影响。
3、每个张量引擎都有其专属的路径和引脚连接到其存储体,与其他张量引擎不共享任何路径和引脚。因此,控制器非常简单,无需进行任何机会性的事务重排序。这使得访问延迟是确定性的。
关键在于:SRAM 的确定性行为具有诸多优势,而 3D DRAM 则以 HBM 无法企及的方式保持了这种特性。需要注意的是,DRAM 技术本身对数据的存储和检索方式非常敏感。与 SRAM 不同,SRAM 的访问模式无关紧要,而任何类型的 DRAM,无论是 HBM 还是 3D DRAM,都需要软硬件协同设计,以便合理布局权重和键值缓存,从而最大化页面命中率。
结论
常见问题包括散热、冷却、翘曲、电源分配网络 (PDN) 和良率。这些问题都很合理,而且都是可以解决的。业内大多数厂商已经在着手解决这些问题。HBM5 预计将采用混合键合技术,这项技术正蓄势待发,即将进入成熟阶段。
就散热而言,短期内我们可能只能实现 4 层堆叠。8 层堆叠仍然存在一些需要工程解决的问题。真正的难题在于位于内存堆叠下方的计算芯片的功率密度。DRAM 非常怕热,其功耗仅为 0.5 W/mm²,因此实现 4 层堆叠可能不成问题。而像 Rubin 这样的 GPU,功耗高达 1.5 W/mm²,可能很容易达到 2 层堆叠,但要实现 4 层堆叠则可能需要一些工程设计。
这些评论基于我的经验和直觉。我想表达的更重要的观点是:Raptor 只采用一层 DRAM,而其后续的 Lightning 加速器将采用四层 DRAM,这是有原因的。除此之外,还有许多工程方面的问题需要解决。
*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。







