
以下为原文:
你是否曾好奇,DeepSeek会以怎样的方式赚取巨额利润?
该企业并未像GLM、MoonShot、MiniMax等团队一样,推出具备竞争力的代码生成相关产品,也没有研发多模态、音频、视频类模型。时至今日,其配套部署框架仍未成型,近期才开始招聘相关人员搭建框架。
长期来看,DeepSeek始终坚持开源路线,毫不吝啬地分享自身核心技术。这一切举动看起来像是莽撞行事?或是无端耗费资金?计划向其注资百亿美元的投资者,难道是在白白挥霍钱财?
在我看来,事实恰恰相反。
下文将梳理DeepSeek过往发展举措,剖析其奉行的发展战略。
DeepSeek创始人梁文峰着眼于更为宏大的目标,企业自身有望达成万亿美元估值,同时还将助力打造出规模达十万亿美元的产业市场。

回顾DeepSeek的崛起之路
当下行业普遍选择循序渐进优化模型、快速落地应用产品,代码类产品便是主流方向,而DeepSeek始终逆势而行。
我在 2025 年 1 月 27 日发过一条爆火推文,把 DeepSeek 的发展称为“英雄之旅(Hero’s Journey)”。
而如今,这个故事变得更加有趣了。
- 当别人还在构建 Dense Model(稠密模型)时,DeepSeek 去做了训练难度极高的 MoE(Mixture of Experts,混合专家模型)。
- 他们采用“第一性原理”方法,发明了新的 GRPO 算法,用来替代 RL 中主流但昂贵的 PPO 算法。
- 他们提出 RLVR(Reinforcement Learning from Verified Rewards,基于可验证奖励的强化学习),把它作为提升模型推理能力的关键策略。
- 他们提出了通过 “Multi Token Prediction” 实现 Speculative Decoding(推测解码)的简单策略,同时强化了训练信号。
- 他们完善了 “ZERO bubble” pipeline,以提升有限 GPU 资源的利用率。
- 他们发布了 Expert Load Balancer,使所有人都更容易部署 MoE 模型。尤其是 “Wide Expert Parallel” 策略,可以通过更大的 batch 极大降低推理成本。
- 他们发明了 MLA、DSA、CSA、HCA,用于减少 KV Cache 需求,并让上下文增长时的计算需求接近恒定。
- 他们发明了 Engram,用内存换算力。
- 他们发明了 mHC,实现模型规模增长时的稳定训练。
- 还有更多……
在“英雄之旅”这种经典叙事结构里,英雄一开始并不知道自己的最终使命是什么。
他会在旅途中不断学习,并逐渐发现自己真正的伟大使命。一路上,他会遇到大量质疑者、恶意攻击者;他自身也存在缺陷与短板;他会遭遇看似无法克服的挑战;但最终,他会学会如何建立联盟、如何高效利用有限资源,并最终完成使命。
正因为如此,观众才会为英雄加油。

这也是 DeepSeek 能够赢得全球粉丝、尊敬,以及争议的原因。
而接下来我会详细说明:DeepSeek 走到今天,似乎已经发现了他们真正的终极目标:不是卖编程订阅服务,而是打造一个价值 10 万亿美元的中国 AI 硬件生态系统,并让自身达到 1 万亿美元估值。
与此同时,他们也会推动西方硬件生态出现更多新进入者。
欢迎各界评论探讨
先来做一点 KV Cache 的有趣计算
看看 @SemiAnalysis_ 最近这条非常及时的推文:

DeepSeek 已经比任何人都更好地解决了这个问题。
我们先做一点有趣的 KV Cache 数学计算。即使你不喜欢数学也没关系。我们使用最近发布的 KV Cache 计算器,来看看 DeepSeek V4 Pro 相比最新的 GLM 和 Qwen 模型,在 KV Cache 上节省了多少。
计算条件:
- 100 万 context
- KV 精度:8-bit
- indexer 精度:16-bit
你也可以自己玩这个计算器:
https://kvcache.ai/tools/kv-cache-calculator/

在 100 万上下文长度下:
- DeepSeek V4 只需要 5.48GB HBM
- GLM5 需要 60GB HBM
- Qwen3-235B-A22B 更夸张,需要 89GB
注意:
- DeepSeek 是 1.6T 参数模型
- GLM5 大约 700B 参数,已经使用了 DeepSeek 的 MLA 与 DSA,但还没使用最新压缩 attention
- Qwen3-235B-A22B 大约 235B 参数,使用的是 GQA attention
DeepSeek 在降低内存压力方面做出了基础性贡献。
如果这些创新被广泛采用,它将使长时任务 Agent 的成本变得极低,并解锁下一代应用场景。

“疯狂”背后的逻辑
KV Cache 之所以能做到如此小,而且不牺牲质量,是因为:
他们因此能够以极低价格提供长时间缓存服务——价格不到 Sonnet 4.6 Cache Hit 的 3%,并且缓存可保留数小时。
对于长时任务而言,小 KV Cache 可以非常高效地卸载到 SSD,再重新加载。
这大幅降低了对 HBM 的需求。
而 HBM 恰恰是中国 AI 硬件产业中最短缺、最难制造的内存。
DeepSeek 还在 Dual Path 论文中提出了更快从 SSD 加载 KV Cache 的技术。

KV Cache 压缩的直接受益者是谁?
谁能大量供应 SSD?
别忘了,YMTC 正在崛起为 3D NAND 巨头。
NAND 让 DeepSeek 可以避免重复计算 KV。
反过来,DeepSeek 又为 NAND 与 SSD 创造了巨大的市场——不仅是 YMTC,而是整个产业。

不只是 NAND 与 SSD
LPDDR 也有巨大潜力。
它可以用来存储模型权重,并在需要时“即时流式传输”到 HBM,从而降低 HBM 压力。
SGLang 团队已经发表过相关博客。
虽然 DeepSeek 没有专门为此设计,但他们的 MoE 架构、大量 Experts,以及 4-bit 权重,使这种方案非常容易实现。

这种创新,再加上超高压缩率的 KV Cache(且几乎无损),会显著降低 HBM 需求。
中国谁在做 LPDDR?
CXMT。

他们在 LPDDR 速度上只落后半代,在密度上只落后一代。
并不远。
再加上中国未来会拥有大量 NAND 与 LPDDR,这是否能缓解算力压力?
答案是:可以。
更聪明地利用内存,也能降低 GPU/ASIC 压力
NAND 用于 KV Cache 的价值很明显:
- 可以更长时间保留 KV Cache
- 降低 HBM 压力
- 避免重复计算 KV
- 缓解 GPU 与 ASIC 的算力压力
那么 LPDDR 是否也能发挥类似作用?
答案仍然是:可以。
LPDDR 还可以存储一种叫做 “Engram” 的结构。
在 Engram 论文中,DeepSeek 指出:
虽然 MoE 通过条件计算扩展模型容量,但 Transformer 缺乏原生的知识检索机制。
因此,它们只能通过计算来低效地模拟“检索”。
于是他们提出了 Engram:
一种基于 O(1) 哈希查找的现代化 N-gram embedding 模块。
他们称之为 “conditional memory(条件记忆)”。
这种方式节省了大量计算,但需要大量内存来存储 embedding table。
本质上,这是经典的“内存换算力”。
关键洞察在于:
LPDDR 的内存读取成本,远远低于完整 Transformer forward pass 的计算成本。
因此,在大规模系统中,这种交换极其划算。

这些取舍非常值得
中国 GPU 与 ASIC 在原始 FLOPs 上,长期都可能落后于西方 GPU。
原因包括:
- 没有 EUV
- 晶体管密度不足
- 封装技术落后
因此,“用更多内存换更少计算”这种路线,非常值得。
尤其是在中国能够大量生产 NAND 与 LPDDR 的情况下。
DeepSeek 的长期布局
从所有这些创新来看:
DeepSeek 的目标,似乎并不是赚取几亿美元的短期利润。
否则,他们完全可以:
- 做多模态
- 做语音
- 做视频
但他们没有。
他们在玩的是一个耐心的“10 万亿美元游戏”:
打造替代性的 AI 硬件生态。
这不仅仅是让中国内存厂商成为 AI 硬件关键玩家。
更重要的是:
他们正在从根本上降低 AI 对资源的需求。
这样一来:
- 更多 GPU/ASIC 厂商会变得可行
- 更多网络芯片厂商会变得可行
- 西方开源生态也会受益
- 新硬件创业公司也会受益
所有的迹象都表明了这一点。让我们来详细重温一下他们提出的所有创新:
1.在DeepSeek V2中引入了混合专家模型(MoE)和MLA。
MoE使得以减少40%到50%计算量的方式训练极具智慧的模型成为可能。MLA使得将KV Cache减少90%成为可能。这使得将KV Cache卸载到SSD变得非常高效。
这些想法是在他们2024年5月的DeepSeek V2论文中引入的。它随后解锁了DeepSeek V3的训练,这在当时几乎相当于闭源水平,而他们当时仅仅使用了2048张被阉割的H800 GPU。
2 .DSA(在DeepSeek V3.2 Exp中引入)用以减少长上下文场景下的计算量,并缓解HBM带宽的压力。
它确保了计算量不会随着上下文的增长而暴涨。
请看下面的图表——DeepSeek-v3.2的处理时间在不同上下文长度下保持平稳。

3. mHC于2025年12月在论文《mHC: Manifold-Constrained Hyper-Connections》中引入。
mHC是DeepSeek的一项宏观架构创新,它重新发明了信息在Transformer层之间流动的方式。
自ResNet以来,行业一直使用标准的残差连接(x + F(x)),而mHC将残差流扩展为多条平行的信息高速公路,并允许在它们之间进行学习型的混合。
但至关重要的是,它将混合矩阵约束为双随机矩阵(通过Sinkhorn-Knopp投影到Birkhoff多胞形上),这在数学上保证了信号幅度在任意深度下都能得以保持。
这解决了此前困扰无约束Hyper-Connections(最初由ByteDance发明)的灾难性不稳定问题——在无约束情况下,信号放大在27B规模下暴增了3000倍,导致训练彻底崩溃。
其计算成本微乎其微:mHC仅增加了6.7%的实际训练耗时,因为它没有改变注意力层或FFN层的FLOPs,只是改变了它们的输出在层与层之间的路由方式。
然而,其性能提升却是巨大的:在27B参数规模下,mHC在BIG-Bench Hard推理上提升了+7.2分,在DROP上提升了+3.2分,在GSM8K数学上提升了+2.8分,在MMLU通用知识上提升了+1.4分,而这一切都是在相同的模型大小和几乎相同的计算预算下实现的。
从本质上讲,mHC通过为网络提供更丰富、更具表现力的跨层信息路由拓扑结构,在几乎不增加额外FLOPs成本的情况下,实现了显著更高的“单参数智能”。

mHC是一个复杂的架构;但它提供了极高的训练稳定性和更高的单参数智能。
1 . CSA和HSA(于2026年4月在DeepSeek V4中引入)通过压缩KV Token,将KV需求进一步降低了90%,并大幅减少了所需的FLOPs,从而同时缓解了HBM和GPU/ASIC的压力。

2 . Engram于2026年第一季度引入,他们在某种程度上用内存(LPDDR内存)换取了计算。
如下面的详细图表所示,在相同的总参数预算下,Engram带来了显著的性能提升。

3 . 极端专注于计算与通信的重叠,以及像Dual Path这样的创新,可以被解释为应对资源限制的权宜之计。
但DeepSeek走得更远,他们甚至在ASIC设计上为硬件厂商提供建议,以确保他们不会浪费宝贵的硅片资源。
这出自DeepSeek V4的论文。

这是他们在DeepSeek V4论文中分享的建议。可以肯定的是,他们在私底下分享的反馈要多得多。
4 . 对TileLang的投入指向了同一个始终如一的方向:他们不仅是在解决自己的算力荒,更是在让中国的硬件生态系统具备与西方生态系统竞争的能力。
有了TileLang,只需开发一次算子内核(用于计算的代码),就可以在多个已提供TileLang后端的硬件平台上成功运行。
我预计中国其他所有的实验室也会加入进来——间接帮助中国硬件厂商应对“CUDA护城河”。这也解锁了更多西方硬件(如AMD)的可能性。
注意:中国的许多AI平台要么提供CUDA兼容性,要么提供CUDA转换层:Moore Threads、MetaX、Biren和Iluvatar CoreX是通过转换层实现CUDA兼容度最高的中国芯片。他们(在理论上)不需要TileLang。

大规模强化学习(RL)与RSI
通过获取更多的算力(得益于更多潜在的硬件选择)以及计算需求的降低,DeepSeek可以承担更具雄心的训练项目,尤其是RL后训练(post training)。
RL涉及生成大量的轨迹(trajectories)——生成数万亿的Token。这会很快变得非常昂贵。
此外,为了训练1M上下文的模型,你需要生成那么长的轨迹。为如此长的轨迹训练模型,才能够解锁长文本任务。
此外,由于选择增加,DeepSeek可以获得更多硬件,这将使自动化研究(RSI)成为可能。
RSI涉及AI自身来设计和开展实验。这种方法包含大量的试错,成本会迅速飙升。
然而,RSI对于探索整个设计空间至关重要。DeepSeek在迈向AGI以及随后的ASI之前,需要具备RSI的能力。
DeepSeek今天所做的,就是整个行业明天要做的:
DeepSeek围绕混合专家模型(MoE)、MLA、DSA的创新,已经被来自全球和中国其余的AI实验室所采纳。
例如,ZAI(GLM系列模型的创造者)使用了MLA和DSA。Kimi(Moonshot)采用了MLA,并且毫不避讳地表示他们的架构是基于DeepSeek的架构。
作为回报,DeepSeek使用了最早由Kimi(Moonshot)用于大规模训练的Muon优化器。
(注:MoE于2017年在Google被发明,Noam Shazeer是关键作者。DeepSeek将其应用到了极大的规模并发明了自己的独门绝技。 Muon(由Newton-Schulz正交化的动量)
优化器由机器学习研究员Keller Jordan于2024年底创建。Kimi(Moonshot)团队是第一个将其投入大规模应用的人。)
那么如何赚钱呢?
让我们来研究一下OpenAI这个有趣的例子。
OpenAI获得了根据算力消耗里程碑以低价购买AMD和Cerebras股票的认股权证/期权。这对AMD和Cerebras来说是一笔伟大的交易。有了OpenAI对他们的绑定,使他们更有可能在长期内取得成功。
引自AMD的公告:“作为协议的一部分,为了进一步对齐战略利益,AMD已向OpenAI发行了高达1.6亿股AMD普通股的认股权证,结构设计为随着特定里程碑的达成而分批行权。第一批随着初始1吉瓦(GW)的部署而行权,其余批次随着采购规模扩大到6吉瓦而逐步行权。行权进一步与AMD达到特定的股价目标,以及OpenAI达成使AMD能够规模化部署所需的技术和商业里程碑相挂钩。”

我预测DeepSeek将与多家中国的内存、ASIC、CPU和网络栈厂商达成此类协议,并与他们紧密合作,以确保他们的硬件栈能够胜任顶尖的AI工作负载。
鉴于西方(包括东亚盟友)所有AI股票的总市值远远超过10T USD。这种“通过授予股权进行协作”的方法,让DeepSeek能够帮助在中国创造一个同样巨大的产业,并在自己实现1T USD估值的同时,分得属于自己的一块蛋糕。
这将使他们能够赚到多得多的钱,同时也能实现他们用自己的话所说的“让AGI惠及每个人”的目标。
Liang Wenfeng——Jim Simons的崇拜者——是一位极其聪明的资本家,绝对不会错过这一点!
如果你回顾一下DeepSeek迄今为止所做的一切,这是唯一说得通的逻辑……

这些是关键的AI股票。未显示的还有超大规模云厂商(Hyper-scalars)及其他许多公司。
关于这些创新的详细博客将于本周末发布,如果感兴趣请关注我的Substack
https://polymath707.substack.com/ ...







