Token导航 LogoToken导航

DeepSeek会如何赚到10万亿美元?

更新时间 2026-05-24来源 AI先锋官官方正文 6422字阅读约 21分钟19 张图片
日前,知名科技分析师 GDP发表了篇长文,题目是《DeepSeek 的10 万亿美元宏大战略》,在 X 上引发很大关注,被认为是对 DeepSeek 最深刻的分析。
图片

以下为原文:


你是否曾好奇,DeepSeek会以怎样的方式赚取巨额利润?

该企业并未像GLM、MoonShot、MiniMax等团队一样,推出具备竞争力的代码生成相关产品,也没有研发多模态、音频、视频类模型。时至今日,其配套部署框架仍未成型,近期才开始招聘相关人员搭建框架。

长期来看,DeepSeek始终坚持开源路线,毫不吝啬地分享自身核心技术。这一切举动看起来像是莽撞行事?或是无端耗费资金?计划向其注资百亿美元的投资者,难道是在白白挥霍钱财?

在我看来,事实恰恰相反。

下文将梳理DeepSeek过往发展举措,剖析其奉行的发展战略。

DeepSeek创始人梁文峰着眼于更为宏大的目标,企业自身有望达成万亿美元估值,同时还将助力打造出规模达十万亿美元的产业市场。

图片

回顾DeepSeek的崛起之路

当下行业普遍选择循序渐进优化模型、快速落地应用产品,代码类产品便是主流方向,而DeepSeek始终逆势而行。

我在 2025 年 1 月 27 日发过一条爆火推文,把 DeepSeek 的发展称为“英雄之旅(Hero’s Journey)”。

而如今,这个故事变得更加有趣了。

  • 当别人还在构建 Dense Model(稠密模型)时,DeepSeek 去做了训练难度极高的 MoE(Mixture of Experts,混合专家模型)。
  • 他们采用“第一性原理”方法,发明了新的 GRPO 算法,用来替代 RL 中主流但昂贵的 PPO 算法。
  • 他们提出 RLVR(Reinforcement Learning from Verified Rewards,基于可验证奖励的强化学习),把它作为提升模型推理能力的关键策略。
  • 他们提出了通过 “Multi Token Prediction” 实现 Speculative Decoding(推测解码)的简单策略,同时强化了训练信号。
  • 他们完善了 “ZERO bubble” pipeline,以提升有限 GPU 资源的利用率。
  • 他们发布了 Expert Load Balancer,使所有人都更容易部署 MoE 模型。尤其是 “Wide Expert Parallel” 策略,可以通过更大的 batch 极大降低推理成本。
  • 他们发明了 MLA、DSA、CSA、HCA,用于减少 KV Cache 需求,并让上下文增长时的计算需求接近恒定。
  • 他们发明了 Engram,用内存换算力。
  • 他们发明了 mHC,实现模型规模增长时的稳定训练。
  • 还有更多……

在“英雄之旅”这种经典叙事结构里,英雄一开始并不知道自己的最终使命是什么。

他会在旅途中不断学习,并逐渐发现自己真正的伟大使命。一路上,他会遇到大量质疑者、恶意攻击者;他自身也存在缺陷与短板;他会遭遇看似无法克服的挑战;但最终,他会学会如何建立联盟、如何高效利用有限资源,并最终完成使命。

正因为如此,观众才会为英雄加油。

图片

这也是 DeepSeek 能够赢得全球粉丝、尊敬,以及争议的原因。

而接下来我会详细说明:DeepSeek 走到今天,似乎已经发现了他们真正的终极目标:不是卖编程订阅服务,而是打造一个价值 10 万亿美元的中国 AI 硬件生态系统,并让自身达到 1 万亿美元估值。

与此同时,他们也会推动西方硬件生态出现更多新进入者。

欢迎各界评论探讨

先来做一点 KV Cache 的有趣计算

看看 @SemiAnalysis_ 最近这条非常及时的推文:

图片

DeepSeek 已经比任何人都更好地解决了这个问题。

我们先做一点有趣的 KV Cache 数学计算。即使你不喜欢数学也没关系。我们使用最近发布的 KV Cache 计算器,来看看 DeepSeek V4 Pro 相比最新的 GLM 和 Qwen 模型,在 KV Cache 上节省了多少。

计算条件:

  • 100 万 context
  • KV 精度:8-bit
  • indexer 精度:16-bit

你也可以自己玩这个计算器:

https://kvcache.ai/tools/kv-cache-calculator/

图片

在 100 万上下文长度下:

  • DeepSeek V4 只需要 5.48GB HBM
  • GLM5 需要 60GB HBM
  • Qwen3-235B-A22B 更夸张,需要 89GB

注意:

  • DeepSeek 是 1.6T 参数模型
  • GLM5 大约 700B 参数,已经使用了 DeepSeek 的 MLA 与 DSA,但还没使用最新压缩 attention
  • Qwen3-235B-A22B 大约 235B 参数,使用的是 GQA attention

DeepSeek 在降低内存压力方面做出了基础性贡献。

如果这些创新被广泛采用,它将使长时任务 Agent 的成本变得极低,并解锁下一代应用场景。

图片

“疯狂”背后的逻辑

KV Cache 之所以能做到如此小,而且不牺牲质量,是因为:

他们因此能够以极低价格提供长时间缓存服务——价格不到 Sonnet 4.6 Cache Hit 的 3%,并且缓存可保留数小时。

对于长时任务而言,小 KV Cache 可以非常高效地卸载到 SSD,再重新加载。

这大幅降低了对 HBM 的需求。

而 HBM 恰恰是中国 AI 硬件产业中最短缺、最难制造的内存。

DeepSeek 还在 Dual Path 论文中提出了更快从 SSD 加载 KV Cache 的技术。

图片

KV Cache 压缩的直接受益者是谁?

谁能大量供应 SSD?

别忘了,YMTC 正在崛起为 3D NAND 巨头。

NAND 让 DeepSeek 可以避免重复计算 KV。

反过来,DeepSeek 又为 NAND 与 SSD 创造了巨大的市场——不仅是 YMTC,而是整个产业。

图片

不只是 NAND 与 SSD

LPDDR 也有巨大潜力。

它可以用来存储模型权重,并在需要时“即时流式传输”到 HBM,从而降低 HBM 压力。

SGLang 团队已经发表过相关博客。

虽然 DeepSeek 没有专门为此设计,但他们的 MoE 架构、大量 Experts,以及 4-bit 权重,使这种方案非常容易实现。

图片

这种创新,再加上超高压缩率的 KV Cache(且几乎无损),会显著降低 HBM 需求。

中国谁在做 LPDDR?

CXMT。

图片

他们在 LPDDR 速度上只落后半代,在密度上只落后一代。

并不远。

再加上中国未来会拥有大量 NAND 与 LPDDR,这是否能缓解算力压力?

答案是:可以。

更聪明地利用内存,也能降低 GPU/ASIC 压力

NAND 用于 KV Cache 的价值很明显:

  • 可以更长时间保留 KV Cache
  • 降低 HBM 压力
  • 避免重复计算 KV
  • 缓解 GPU 与 ASIC 的算力压力

那么 LPDDR 是否也能发挥类似作用?

答案仍然是:可以。

LPDDR 还可以存储一种叫做 “Engram” 的结构。

在 Engram 论文中,DeepSeek 指出:

虽然 MoE 通过条件计算扩展模型容量,但 Transformer 缺乏原生的知识检索机制。

因此,它们只能通过计算来低效地模拟“检索”。

于是他们提出了 Engram:

一种基于 O(1) 哈希查找的现代化 N-gram embedding 模块。

他们称之为 “conditional memory(条件记忆)”。

这种方式节省了大量计算,但需要大量内存来存储 embedding table。

本质上,这是经典的“内存换算力”。

关键洞察在于:

LPDDR 的内存读取成本,远远低于完整 Transformer forward pass 的计算成本。

因此,在大规模系统中,这种交换极其划算。

图片

这些取舍非常值得

中国 GPU 与 ASIC 在原始 FLOPs 上,长期都可能落后于西方 GPU。

原因包括:

  • 没有 EUV
  • 晶体管密度不足
  • 封装技术落后

因此,“用更多内存换更少计算”这种路线,非常值得。

尤其是在中国能够大量生产 NAND 与 LPDDR 的情况下。

DeepSeek 的长期布局

从所有这些创新来看:

DeepSeek 的目标,似乎并不是赚取几亿美元的短期利润。

否则,他们完全可以:

  • 做多模态
  • 做语音
  • 做视频

但他们没有。

他们在玩的是一个耐心的“10 万亿美元游戏”:

打造替代性的 AI 硬件生态。

这不仅仅是让中国内存厂商成为 AI 硬件关键玩家。

更重要的是:

他们正在从根本上降低 AI 对资源的需求。

这样一来:

  • 更多 GPU/ASIC 厂商会变得可行
  • 更多网络芯片厂商会变得可行
  • 西方开源生态也会受益
  • 新硬件创业公司也会受益


所有的迹象都表明了这一点。让我们来详细重温一下他们提出的所有创新:

1.在DeepSeek V2中引入了混合专家模型(MoE)和MLA。

MoE使得以减少40%到50%计算量的方式训练极具智慧的模型成为可能。MLA使得将KV Cache减少90%成为可能。这使得将KV Cache卸载到SSD变得非常高效。

这些想法是在他们2024年5月的DeepSeek V2论文中引入的。它随后解锁了DeepSeek V3的训练,这在当时几乎相当于闭源水平,而他们当时仅仅使用了2048张被阉割的H800 GPU。

2 .DSA(在DeepSeek V3.2 Exp中引入)用以减少长上下文场景下的计算量,并缓解HBM带宽的压力。

它确保了计算量不会随着上下文的增长而暴涨。

请看下面的图表——DeepSeek-v3.2的处理时间在不同上下文长度下保持平稳。

图片

3. mHC于2025年12月在论文《mHC: Manifold-Constrained Hyper-Connections》中引入。

mHC是DeepSeek的一项宏观架构创新,它重新发明了信息在Transformer层之间流动的方式。

自ResNet以来,行业一直使用标准的残差连接(x + F(x)),而mHC将残差流扩展为多条平行的信息高速公路,并允许在它们之间进行学习型的混合。

但至关重要的是,它将混合矩阵约束为双随机矩阵(通过Sinkhorn-Knopp投影到Birkhoff多胞形上),这在数学上保证了信号幅度在任意深度下都能得以保持。

这解决了此前困扰无约束Hyper-Connections(最初由ByteDance发明)的灾难性不稳定问题——在无约束情况下,信号放大在27B规模下暴增了3000倍,导致训练彻底崩溃。

其计算成本微乎其微:mHC仅增加了6.7%的实际训练耗时,因为它没有改变注意力层或FFN层的FLOPs,只是改变了它们的输出在层与层之间的路由方式。

然而,其性能提升却是巨大的:在27B参数规模下,mHC在BIG-Bench Hard推理上提升了+7.2分,在DROP上提升了+3.2分,在GSM8K数学上提升了+2.8分,在MMLU通用知识上提升了+1.4分,而这一切都是在相同的模型大小和几乎相同的计算预算下实现的。

从本质上讲,mHC通过为网络提供更丰富、更具表现力的跨层信息路由拓扑结构,在几乎不增加额外FLOPs成本的情况下,实现了显著更高的“单参数智能”。

图片

mHC是一个复杂的架构;但它提供了极高的训练稳定性和更高的单参数智能。

1 . CSA和HSA(于2026年4月在DeepSeek V4中引入)通过压缩KV Token,将KV需求进一步降低了90%,并大幅减少了所需的FLOPs,从而同时缓解了HBM和GPU/ASIC的压力。

图片

2 . Engram于2026年第一季度引入,他们在某种程度上用内存(LPDDR内存)换取了计算。

如下面的详细图表所示,在相同的总参数预算下,Engram带来了显著的性能提升。

图片

3 . 极端专注于计算与通信的重叠,以及像Dual Path这样的创新,可以被解释为应对资源限制的权宜之计。

但DeepSeek走得更远,他们甚至在ASIC设计上为硬件厂商提供建议,以确保他们不会浪费宝贵的硅片资源。

这出自DeepSeek V4的论文。

图片

这是他们在DeepSeek V4论文中分享的建议。可以肯定的是,他们在私底下分享的反馈要多得多。

4 . 对TileLang的投入指向了同一个始终如一的方向:他们不仅是在解决自己的算力荒,更是在让中国的硬件生态系统具备与西方生态系统竞争的能力。

有了TileLang,只需开发一次算子内核(用于计算的代码),就可以在多个已提供TileLang后端的硬件平台上成功运行。

我预计中国其他所有的实验室也会加入进来——间接帮助中国硬件厂商应对“CUDA护城河”。这也解锁了更多西方硬件(如AMD)的可能性。

注意:中国的许多AI平台要么提供CUDA兼容性,要么提供CUDA转换层:Moore Threads、MetaX、Biren和Iluvatar CoreX是通过转换层实现CUDA兼容度最高的中国芯片。他们(在理论上)不需要TileLang。

图片

大规模强化学习(RL)与RSI

通过获取更多的算力(得益于更多潜在的硬件选择)以及计算需求的降低,DeepSeek可以承担更具雄心的训练项目,尤其是RL后训练(post training)。

RL涉及生成大量的轨迹(trajectories)——生成数万亿的Token。这会很快变得非常昂贵。

此外,为了训练1M上下文的模型,你需要生成那么长的轨迹。为如此长的轨迹训练模型,才能够解锁长文本任务。

此外,由于选择增加,DeepSeek可以获得更多硬件,这将使自动化研究(RSI)成为可能。

RSI涉及AI自身来设计和开展实验。这种方法包含大量的试错,成本会迅速飙升。

然而,RSI对于探索整个设计空间至关重要。DeepSeek在迈向AGI以及随后的ASI之前,需要具备RSI的能力。

DeepSeek今天所做的,就是整个行业明天要做的:

DeepSeek围绕混合专家模型(MoE)、MLA、DSA的创新,已经被来自全球和中国其余的AI实验室所采纳。

例如,ZAI(GLM系列模型的创造者)使用了MLA和DSA。Kimi(Moonshot)采用了MLA,并且毫不避讳地表示他们的架构是基于DeepSeek的架构。

作为回报,DeepSeek使用了最早由Kimi(Moonshot)用于大规模训练的Muon优化器。

(注:MoE于2017年在Google被发明,Noam Shazeer是关键作者。DeepSeek将其应用到了极大的规模并发明了自己的独门绝技。 Muon(由Newton-Schulz正交化的动量)

优化器由机器学习研究员Keller Jordan于2024年底创建。Kimi(Moonshot)团队是第一个将其投入大规模应用的人。)

那么如何赚钱呢?

让我们来研究一下OpenAI这个有趣的例子。

OpenAI获得了根据算力消耗里程碑以低价购买AMD和Cerebras股票的认股权证/期权。这对AMD和Cerebras来说是一笔伟大的交易。有了OpenAI对他们的绑定,使他们更有可能在长期内取得成功。

引自AMD的公告:“作为协议的一部分,为了进一步对齐战略利益,AMD已向OpenAI发行了高达1.6亿股AMD普通股的认股权证,结构设计为随着特定里程碑的达成而分批行权。第一批随着初始1吉瓦(GW)的部署而行权,其余批次随着采购规模扩大到6吉瓦而逐步行权。行权进一步与AMD达到特定的股价目标,以及OpenAI达成使AMD能够规模化部署所需的技术和商业里程碑相挂钩。”

图片

我预测DeepSeek将与多家中国的内存、ASIC、CPU和网络栈厂商达成此类协议,并与他们紧密合作,以确保他们的硬件栈能够胜任顶尖的AI工作负载。

鉴于西方(包括东亚盟友)所有AI股票的总市值远远超过10T USD。这种“通过授予股权进行协作”的方法,让DeepSeek能够帮助在中国创造一个同样巨大的产业,并在自己实现1T USD估值的同时,分得属于自己的一块蛋糕。

这将使他们能够赚到多得多的钱,同时也能实现他们用自己的话所说的“让AGI惠及每个人”的目标。

Liang Wenfeng——Jim Simons的崇拜者——是一位极其聪明的资本家,绝对不会错过这一点!

如果你回顾一下DeepSeek迄今为止所做的一切,这是唯一说得通的逻辑……

图片

这些是关键的AI股票。未显示的还有超大规模云厂商(Hyper-scalars)及其他许多公司。

关于这些创新的详细博客将于本周末发布,如果感兴趣请关注我的Substack 

https://polymath707.substack.com/ ...

文章标签DeepSeek芯片应用落地
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多