高性能、高容量的NAND闪存芯片堆叠式存储模块正因其在高性能人工智能推理系统中的应用而备受关注。正如此前报道,半导体存储巨头闪迪和SK海力士自2025年8月起一直在联合开发一种名为“HBF(高带宽闪存)”的高带宽闪存模块。
今年 8 月,全球最大的半导体存储器制造商三星电子透露,它正在开发一种名为“zNAND-O(On-device)”的高性能存储模块,该模块将用于 NAND 闪存的硅芯片堆叠在一起。
采用堆叠式NAND闪存芯片的高容量模块已经存在一段时间了。闪存芯片垂直堆叠,并通过引线键合连接。整个堆叠结构随后被密封在一个塑料封装内。
然而,采用引线键合时,寄生元件不可忽略,这限制了传输速度的提升。因此,人们尝试通过使用硅通孔(TSV)连接芯片来提高整体性能(速度和功耗),因为硅通孔的寄生元件更少。
问题在于成本上升。与引线键合相比,TSV的制造成本要高得多。对于简单的存储器芯片堆叠而言,产品的附加值仅限于容量的增加,因此难以抵消成本的上涨。

然而,即使采用TSV堆叠技术,如果能够显著提升整个模块的价值,那么增加的成本也是可以接受的。这方面的先驱案例就是采用堆叠式DRAM芯片的高带宽内存(HBM)模块。
采用堆叠式NAND闪存芯片的“HBF”宽带模块可以被视为HBM的闪存版本。三星电子(以下简称三星)目前正在开发的“zNAND-O”宽带存储模块则兼具上述两种特性。
zNAND-O 存储模块设计用于与人工智能加速器(例如 NPU,即神经处理单元)集成封装。该存储模块底部为一个基础芯片(逻辑芯片),上方有四个或八个核心芯片(NAND 闪存芯片)。这种一个基础芯片和多个核心芯片的组合方式与 HBM 和 HBF 相同。
乍一看,“zNAND-O”和宽带闪存“HBF”非常相似。然而,它们的细节却有所不同。首先,每个存储模块的核心芯片数量不同。“zNAND-O”有4个或8个芯片,而“HBF”有8个或16个芯片,数量是“zNAND-O”的两倍。
其次,内存模块和AI加速器的接口不同。虽然两者都使用芯片输入/输出标准“UCIe(通用芯片互连高速)”,但“zNAND-O”对树脂基板(封装基板)使用“UCIe-S(标准封装)”,而“HBF”对中间基板(中介层)使用“UCIe-A(高级封装)”。
核心芯片上的NAND闪存略有不同。“zNAND-O”采用的是V10代(也称BV10代)制造工艺,其多级存储方式为SLC(1比特/单元)(即并非多级存储)。BV10代NAND闪存是最新一代产品,拥有超过400层字线。在BV代工艺中,外围电路和存储单元阵列分别在不同的晶圆上制造,然后在生产过程中将晶圆键合在一起。
此外,由于采用了SLC方法,读取延迟时间(延迟)很短。核心芯片的内存容量和I/O数量未知(根据后面描述的AI系统,核心芯片容量估计为512 Gbit)。
另一方面,“HBF”的核心芯片具有256 Gbit的存储容量和1024位的输入/输出总线宽度。制造工艺和多级存储方式均未明确说明。考虑到256 Gbit的存储容量相对较小,其多级存储方式很可能是MLC(2位/单元)或SLC(1位/单元)。
在FMS大会的主题演讲中,三星展示了将zNAND-O引入处理数万亿参数的AI系统将如何改变内存架构。三星将zNAND-O与采用DRAM模块(统一内存架构(UMA))的传统系统进行了对比。
在传统系统中,CPU、NPU 和 GPU 访问 UMA 的 DRAM 模块。随着 AI 系统性能的提升,参数数量超过万亿,KV 缓存的存储容量不断扩大,DRAM 模块的存储容量要么不足,要么 DRAM 的成本上升到无法接受的水平。
在采用“zNAND-O”的系统中,NPU会同时访问DRAM和“zNAND-O”模块。“zNAND-O”模块主要存储只读的模型参数(权重参数)。由于NAND闪存的单位存储容量成本较低,因此与传统系统相比,内存成本可以显著降低。
三星通过仿真进一步比较了仅使用DRAM的AI系统和采用“zNAND-O”技术的AI系统的内存成本和推理性能。所使用的大规模语言模型(LLM)为“GPT-OSS-120B”,上下文长度设置为32K个词元。
仿真结果表明,尽管引入“zNAND-O”后内存成本显著降低至原来的六分之一,但推理性能(每秒词元数)几乎与仅使用DRAM的AI系统相当。此外,推理模型中可存储的最大参数数量翻了一番。
目前,“zNAND-O”仍处于概念阶段,预计要到2028年才能推出产品样品,距离最终上市还有很长一段时间。我们期待未来研发成果。
(来源:编译pcwatch)
*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。







