
👧🏻 作者: Shirley Wu
🥷 编辑: Koji
🧑🎨 排版: NCon

2026 年 5 月 14 日,Cerebras Systems 在纳斯达克挂牌交易。
最终 IPO 定价为每股 185 美元,招股价区间从最初 115-125 美元一路抬升至 150-160 美元,又在路演最后阶段再度上调;发行规模也从 2800 万股扩大到 3000 万股。一次 IPO 就募集了 55 亿美元。
更戏剧性的是开盘瞬间,股价直接跳升至 385 美元,较发行价上涨 108%,这是自 2019 年 Uber 上市以来美国规模最大的科技公司 IPO。
据 TechCrunch 报道,盘中股价回落至 330 美元附近、收盘报 311 美元,对应市值约 660 亿美元;按盘后交易价格估算,估值进一步上探至千亿美元区间。

而仅在一年之前,这一切还看起来遥遥无期。
Cerebras 早在 2024 年就提交过招股说明书,但因阿布扎比主权基金 G42 的持股触发了美国外资投资委员会(CFIUS)的长期审查,加之营收高度集中于 G42 一个客户,IPO 计划当时被搁置。
直到 2026 年 4 月,公司公布 2025 年营收 5.1 亿美元,同比增长 76%,并在前一年亏损近 5 亿美元的情况下扭亏为盈,净利润达 2.378 亿美元,市场情绪才被重新点燃。
如果要给这一刻找一个最清晰的注脚,或许是在 AI 算力被普遍认为"只能等于 Nvidia"的一年之后,市场用真金白银开出了一个不一样的答案。
颇有戏剧性的是,Stratechery 的 Ben Thompson 在 IPO 前几天发布了一期题为《The Inference Shift》的播客与同名长文。
文章没有评论 Cerebras 的估值,但提供了一个让我们重新审视这次 IPO 的结构性框架。

Ben 把 LLM 时代的推理工作负载切分成了两类,认为它们将走向截然不同的硬件归宿:
本质特征是"有人在等"。无论是 ChatGPT 的对话、Claude Code 里的代码补全,还是未来 AI 可穿戴设备的语音交互,只要响应方需要被人类感知,token 的生成速度就是核心约束。这是 GPU 的 HBM、Cerebras 的 SRAM 以及 Groq 的 LPU 等共同竞逐的战场。
本质特征是"没人在等"。当一个 Agent 架构整夜在跑一个长任务、当机器把任务派发给另一台机器去完成,"用户体验"这个词不再适用。Ben 指出,这种工作负载真正稀缺的不是带宽和速度,而是内存容量,即上下文、状态、历史、嵌入向量、对象存储里的中间产物,全部都需要被"记住",但完全不需要"很快地被记住"。
由此 Ben 给出了一个非常关键的判断:如果延迟不再是约束,那么"为延迟付溢价"的整套架构假设就会松动。智能体推理更看重的是更便宜的 DRAM、更慷慨的容量、够用的算力,而不是顶级 HBM 与最快的 NVLink。
在这种新的工作负载下,GPU 会被解绑,CPU 的工具使用速度甚至比 GPU 的 token 速度更值得关心。
Ben 的最终结论是:训练市场仍由 Nvidia 主导;答案推理是一个"有意义但相对小众"的市场,Cerebras 与 Groq 等 SRAM 机器在此具备结构性优势;而智能体推理将是规模最大的市场,因为它不再受人类时间约束、只受计算机运行时间约束。
Jensen Huang 多年来反复说"摩尔定律已死",他的意思是性能进步要靠系统创新;但 Ben 给出了一个更尖锐的版本:
把这个框架放回 IPO 当天的纳斯达克,会得到一个让人不安的小问题:市场为 Cerebras 开出了 660 亿至 1000 亿美元的估值,但它定价定的是答案推理这条赛道。
如果 Ben 是对的,这意味着市场押注的并不是未来算力的大盘。
Cerebras CEO Andrew Feldman 当然清楚在 IPO 前必须解决哪几个心理障碍,当被问到"为了说服投资者,在这次路演期间做的最重要的三件事是什么"时,他的回答可以归纳为以下三个核心论点:
而这三个论点共同构成了 Cerebras 上市的标准叙事。

但如果把视角换成 SemiAnalysis 在 IPO 前夕发布的《Cerebras — Faster Tokens Please》这份长文(全文相当于他们 4 篇普通文章的体量,我们截取部分),上述叙事的成色就会被技术与商业现实反复压力测试。下面三个层面尤其关键:
SemiAnalysis 同时确认了 Cerebras 的两个事实:一方面 WSE-3 整片晶圆有 44GB SRAM、提供 21 PB/s 的内存带宽,比英伟达 H100 的 HBM 带宽高出约 6000 倍,这是它在"快"这件事上的全部底气;
另一方面 WSE-3 晶圆与晶圆之间通信的带宽仅 150 GB/s,这大约只有英伟达 GPU 之间互联通道(NVLink 5)的六分之一。
这个带宽限制带来的直接后果是:Cerebras 服务大模型时被迫只能走 Pipeline 并行(pipeline parallelism)。
你可以把它想象成一条工厂流水线:每一片晶圆只负责模型的某几层,做完后把"半成品"(激活值)传给下一片晶圆,整条流水线协作完成一次推理。
这种方式只在相邻晶圆之间传递少量中间结果,而不需要在晶圆之间搬运庞大的模型权重。
这个方案在小模型上行得通,在大模型上就开始难看:
•Cerebras 公有云目前能提供的最大正式(Production)模型只到 GPT-OSS(120B 参数);最大预览(Preview)模型也只到 GLM 4.7(355B)。
•Llama 3.1 405B、Qwen 3 Coder 480B、Llama 4 Maverick、Llama 3.3 70B 等曾经上线过的大模型现已被全部下架(Deprecated)。SemiAnalysis 推测是服务这些模型的单位成本撑不住。
•而 DeepSeek V3 和 Kimi K2 这两个被市场广泛使用的开源前沿模型,从未在 Cerebras 的公开端点上线过。
•公有端点的最大上下文窗口被钉在 128K。

更关键的是 SemiAnalysis 自己抓取的生产侧数据。
他们通过一个匿名代理收集了来自 Claude Code、Codex、Cursor、OpenCode 等智能体编程工具的真实请求,样本规模约 43.2 万条请求、约 800 亿 token。
结论是:“典型的 P50 输入序列长度(ISL)约为 96.3K token,并非 64K 或更少……我们的请求中近 50% 超过 128K,而 128K 正是 Cerebras 当前公开端点所支持的最大上下文窗口。”

从图中可以清楚看到,128K 这条线正好落在 P50 与 P75 之间,而 Cerebras 公有端点目前支持的最大上下文窗口恰好是 128K。
换句话说,今天 agentic 编程市场的中位请求已经逼近 Cerebras 的硬上限,近一半请求直接超出它的服务能力。更值得注意的是右侧的长尾:P90 接近 50 万 token,P95 超过 67 万,这是 Agent 工具在大量加载 skills、system prompts、tool use context 之后自然产生的真实工作负载形态,而非边缘异常值。
让我们把这张图重新带回 Ben Thompson 的分析框架,他判断智能体推理(Agentic Inference)真正稀缺的是内存容量而非速度,这张分布图正是这个判断在生产数据上的具体对照 —— Cerebras 在 agentic 赛道上面对的不是"跑得不够快",而是结构性"装不下"。
当前 WSE-3 晶圆架构面临的难题,不仅是 SRAM 容量被晶圆面积锁死,更是片外带宽限制了多片协同时的内存池化能力。
雪上加霜的是 SRAM 工艺红利已近枯竭:WSE-1 在 16nm 上有 18GB SRAM,WSE-2 在 7nm 上跃升至 40GB,但 WSE-3 在 5nm 上只到 44GB(仅 +10%)。
SemiAnalysis 同时指出,N3E 及以后的工艺节点 SRAM 几乎不再缩小(见下图),下一代 CS-4 系统如果沿用同款 WSE-3 硅片,得靠提高功耗换取更高时钟频率。
换句话说,Cerebras 在容量这条战线上没有便宜的下一步。

OpenAI 在 Cerebras 的未来中扮演着举足轻重的角色。SemiAnalysis 详细披露了 Cerebras 与 OpenAI 在 2025 年 12 月签订的主合作协议:
OpenAI 承诺在 2026–2028 年分批采购 750 兆瓦 AI 推理算力,每批合约期 3–4 年,可延长至 5 年;并持有额外采购 1.25 吉瓦的选择权,届时总规模将扩展至 2 吉瓦。
截至 2025 年 12 月 31 日,Cerebras 招股书披露的未履约金额为 246 亿美元,几乎全部来自 OpenAI 一家。
OpenAI 同时向 Cerebras 提供了一笔 10 亿美元、年利率 6% 的营运资金贷款;如果 Cerebras 通过算力或硬件交付来偿还,则利息全免;若合作协议因非 OpenAI 重大违约的原因被终止,Cerebras 可能被要求立即偿还本息。
Cerebras 向 OpenAI 发行了 33,445,026 股 N 类(无投票权)普通股的认股权证,完全稀释后 OpenAI 可能持有 Cerebras 约 12% 的股份。
将这三件事叠在一起看,可以发现 OpenAI 既是 Cerebras 的最大客户,也是最大债权人、最大单一股东之一。
Cerebras 在 2025 年 5.1 亿美元的营收中,相对于客户兼股东兼债权人为锁定供给所做的战略性采购,有多大比例真正来自独立的、可持续的市场需求,这个问题在招股书上还暂时看不出答案。
最后 SemiAnalysis 还不忘提醒读者。
OpenAI 在 2026 年 2 月发布的 GPT-5.3-Codex-Spark 在 Cerebras 上跑出了每个用户每秒可处理高达 2000 个 token 的惊人速度,但这并不是真正的 GPT-5.3-Codex,而是基于 gpt-oss-120B 架构、从 GPT-5.3-codex 模型蒸馏而来的一个比原模型小 10 倍以上的版本。
在今天,让 Cerebras 跑得起来的只是这种轻量化、专门化的模型;而真正承载 OpenAI 主营收的是参数规模在 1 万亿以上的前沿模型,要把这一量级的模型塞进 Cerebras 架构,可能需要付出可观的成本与延迟代价。
把 Ben Thompson 的框架与 SemiAnalysis 的分析报告并置在 IPO 当天,会清楚看到三层错位:
市场为 Cerebras 开出 660 亿至 1000 亿美元的估值,定价的是 fast tokens 这条赛道未来的可扩张性。
但按 Ben 的判断,AI 算力未来真正的大盘是 agentic inference,而 agentic inference 的核心需求是大容量内存层级与够用的算力,不是带宽与速度。Cerebras 押注的恰好处在这股长期趋势的反面。
SemiAnalysis 自己的 agentic 编程请求样本显示,主流 agentic 工作负载的上下文长度已经触达甚至超过 Cerebras 公有端点的 128K 上限。
今天还在为"快"付费的最大客户是有人类等待的代码生成场景;可一旦 Agent 真正脱离人类回路独立运行,对速度的偏好就开始让位于对容量与状态保留的偏好。这正在发生,而非未来时。
Cerebras 招股书上写着 246 亿美元的在手订单(即"剩余履约义务"),但当客户、债权人、股东叠在同一个对手方身上时,这个数字的会计含义和经济含义并不等价。
OpenAI 之所以愿意一次性锁定 750 兆瓦容量,部分理由确实是看到了 fast tokens 的市场需求;但更现实的理由也许只是:作为一家正在四处锁定算力供给的公司,把 Cerebras 这种相对小众但具备差异化能力的供应商纳入自家算力组合,是一种合理的对冲行为。
这并不直接证伪 Cerebras 的长期价值,但确实意味着,这 246 亿衡量的更多是 OpenAI 的算力策略广度,而不是 Cerebras 的独立商业实力。
但不得不承认,Cerebras 是过去十年硬件领域最大胆、也最成立的工程赌注之一。能把一整片 300mm 晶圆做成单一可寻址芯片,并解决良品率、功率传输、25kW 散热等一系列问题,这本身就是一项了不起的工程成就。
其次,fast tokens 这条赛道是真实存在的市场。
SemiAnalysis 自己披露其 80% 的 AI 预算(峰值年化 1000 万美元)花在了 Opus 4.6 Fast 模型上,这是以 6 倍价格换取 2.5 倍速度。
Nvidia 在 2025 年 12 月以"许可式收购"方式吸纳 Groq,进一步证明 SRAM 机器的市场不是想象出来的。Cerebras 在这个赛道里是真正的赢家。
此外,CEO Andrew Feldman 关于"CUDA 锁定被高估"的判断,从 Gemini 3 在 TPU、Anthropic 在 Trainium 的实践来看,确实在被现实佐证。
Cerebras 的存在本身就在拓宽产业的供给曲线,这对整个行业来说都是好事。
因此,我们不下"高估"或"泡沫"这种结论性判断。我们想说的是:
市场总是先听见声音,再看清结构。IPO 当天的喧嚣属于 fast tokens,但真正决定 Cerebras 长期命运的,是它在 agentic inference 这场更大变迁中的位置。
Ben Thompson 这篇文章不会改变 IPO 当天的市场结果,但它会成为我们一年之后回望这一切时,或许最有价值的那一个对照坐标。
参考资料
[1]https://stratechery.com/2026/the-inference-shift/:https://stratechery.com/2026/the-inference-shift/
[2]https://open.substack.com/pub/semianalysis/p/cerebras-faster-tokens-please?r=7dnfkb&utm_campaign=post-expanded-share&utm_medium=post viewer:https://open.substack.com/pub/semianalysis/p/cerebras-faster-tokens-please?r=7dnfkb&utm_campaign=post-expanded-share&utm_medium=post%20viewer
[3]https://techcrunch.com/2026/05/14/cerebras-raises-5-5b-kicking-off-2026s-ipo-season-with-a-bang/:https://techcrunch.com/2026/05/14/cerebras-raises-5-5b-kicking-off-2026s-ipo-season-with-a-bang/







