
在过去几个季度,当 Oracle、Coreweave 等云服务商因利润低于预期而让市场失望,Azure 的利润率呈现下降趋势时,AWS 的营业利润率却在 2026 年第一季度环比增长了 213 个基点。这主要得益于AWS 与 Anthropic 新的合作模式:Token-as-a-Service(TaaS)。
我们之前讲过很多次的算力租赁,上周四的直播中,还专门请了一个国内token 工厂的朋友,来讲一下国内目前算力租赁和 token 工厂的一些事情,有兴趣的读者可以到星球查看回放。
很多读者应该都听说国内也有些做算力租赁的厂商正在跟大模型厂商谈如何卖 token,而不只是单单的做算力租赁,目前还没听说哪家已经谈拢了,具体的合作模式我们也不得而知,但大家可以看下AWS-Anthropic 的这个合作模式。
AWS-Anthropic 合作模式
传统的云服务商业模式相对简单:客户签订多年期的 IaaS(基础设施即服务)合同,租用 GPU 算力。这种模式的特点是收入稳定、风险可控,但利润率受限于硬件折旧、电力成本和数据中心运营费用的挤压。
AWS 的 Bedrock 平台采用了完全不同的模式。在这个平台上,客户不是租用 GPU,而是直接购买 AI 模型生成的 token。以 Claude 为例,虽然 Anthropic 是模型的销售方,负责记录全部收入,但实际的商业安排要复杂得多。
根据 SemiAnalysis 的分析,AWS 在这个交易结构中获得两层收益:一是基础设施费用,类似于传统的 EC2 实例费用;二是分成费用,作为分发平台和市场的收入分成。此外,当 Anthropic 的每兆瓦算力产生的年化收入超过特定阈值时,还会触发额外的性能激励。
这种模式的经济效益远超传统 IaaS。SemiAnalysis 估算,在 2026 年第一季度,Anthropic 在 Bedrock 上的收入约为每兆瓦 2600 万美元,这使得 Bedrock 的 EBIT 利润率达到约 55%。相比之下,传统的 GPU 租赁业务利润率要低得多。
更重要的是业务规模的快速增长。Bedrock 在 2026 年第一季度和第四季度的收入分别环比增长了 170% 和 60%。目前 Bedrock 已经是一个年化收入 55 亿美元的业务,占 AWS AI 业务的 37%,而 80-90% 的客户使用的是 Anthropic 的模型。
对比之下,Azure 和 Google Cloud 的 AI 业务中,传统 IaaS 仍然占据 80% 以上的份额。这种业务结构的差异,直接导致了利润率表现的分化。
这个模式对双方都有明显的好处。对 Anthropic 来说,它获得了 AWS 庞大的企业客户基础,同时不需要签订昂贵的多年期 IaaS 合同就能获得算力。对 AWS 来说,虽然相比传统的 5 年长期合同,这种模式的收入保障性更弱,但利润率显著更高,而且能够更灵活地应对市场变化。
Anthropic 在 2026 年第一季度的爆发式增长进一步放大了这个模式的威力。该公司在这个季度新增了 210 亿美元的年化经常性收入(ARR),总 ARR 达到 300 亿美元。这主要由 Claude Code 驱动,这款产品在企业市场获得了巨大成功。Anthropic 的推理业务毛利率也从 2024 年的负 94%,提升到 2025 年的 38%,再到 2026 年的 60% 以上。
根据 SemiAnalysis 的模型,在 2026 年第一季度,Bedrock 贡献了 AWS 年度毛利润增长的 30%,尽管它只占 AWS 总收入的 4%。到第二季度,预计 Anthropic 每兆瓦算力的 ARR 将达到 4200 万美元,Bedrock 收入占 AWS AI 业务的比例将提升到 53%,为 AWS 总收入增长贡献 9 个百分点。
自研芯片的战略分水岭
AWS 的另一个关键优势是垂直整合,特别是自研芯片。AWS 的 Trainium 芯片目前已经支撑了 Bedrock 平台 50% 以上的 token 使用量。这不仅降低了对 Nvidia 的依赖,更重要的是显著改善了经济效益。
Trainium 的成功有其特定的条件。首先,Bedrock 的架构对客户隐藏了底层硬件细节,客户只看到 token,不关心这些 token 是由 Nvidia GPU 还是 Trainium 生成的。这种抽象层使得 AWS 可以灵活选择最经济的硬件方案。
其次,Trainium 针对推理和强化学习工作负载进行了优化,在这些场景下,内存带宽比原始计算能力更重要。虽然将模型移植到 Trainium 需要几天时间,比 Nvidia GPU 稍长,但对于大规模部署来说,这个成本是可以接受的。
更被忽视的是 AWS 的 Graviton CPU。随着强化学习和 agentic 工作负载的兴起,CPU 在 AI 训练和推理中的重要性正在上升。AWS 的第五代 Graviton 芯片在性能和总体拥有成本方面都有优势。Graviton4 将集成到 Trainium3 中作为主节点,同时也会单独用于处理强化学习和 agentic 工作负载。AWS 已经与 Anthropic、OpenAI 和 Meta 签订了大规模的 CPU 和 Graviton 合同。
这里有一个重要的判断:自研芯片的成功需要特定的条件。如果云服务商有自己的大规模云业务,自研芯片用于自家服务是合理的,因为可以通过规模效应分摊研发成本,并且能够针对自己的工作负载特性进行优化。
其实就国内情况而言,大家目前也应该能看的比较清楚,CSP们都在自研芯片,而其他第三方的 AI 芯片公司又非常多,但除了那几家龙头,其他每家的销量并不是很多,目前的竞争环境可以说是非常激烈。
TPU 的教训
Google 的 TPU 提供了一个有趣的对照案例。全球领先的三大模型中,有两个是基于 TPU 训练的:Google 自己的 Gemini 和 Anthropic 的 Claude。这似乎证明了 TPU 的技术实力。
但这个现象需要更细致的解读。Gemini 的开发团队来自 Google,对 TPU 极其熟悉。Anthropic 的核心团队很多来自 Google,同样对 TPU 有深入了解。这种技术熟悉度在模型开发的早期阶段非常重要。
然而,最近 Midjourney 团队的爆料揭示了 TPU 的另一面。Midjourney觉得因为使用 TPU,Midjourney 的开发进度延后了一年,主要原因是 TPU 的生态系统不够成熟。如果让他们重新选择,肯定会选择 Nvidia。
这个案例说明了一个关键问题:在 AI 基础设施领域,生态系统的成熟度往往比单纯的性能指标更重要。Nvidia 的 CUDA 生态系统经过十多年的建设,拥有大量的工具、库、教程和有经验的开发者。对于大多数团队来说,这种生态优势远比理论性能的微小差异更有价值。
TPU 的另一个问题是 Google 自身的战略定位。Google 试图同时在多个战场竞争:云服务(对抗 AWS)、硬件(对抗 Nvidia)、AI 模型(对抗 OpenAI 和 Anthropic)、广告(对抗 Meta)、自动驾驶(对抗 Tesla)等等。这种多线作战导致资源分散,容量建设无法满足所有需求。
SemiAnalysis 的分析指出,Google 的内部容量足以支撑一个成功的 AI 实验室,但留给云业务(不包括硬件销售)的增长空间有限。特别是 Gemini Enterprise Agent Platform(之前的 Vertex)作为 Claude 的分发平台,其容量增长显著低于 AWS 的 Bedrock。
此外,Google 还通过 Broadcom 向 Anthropic 销售 TPU 硬件,Google 在其中扮演 IP 授权方的角色。这种一次性的硬件销售收入,与持续的云服务收入相比,商业价值要低得多。
三大云厂商的不同命运
容量建设正在成为 AI 云竞争的终极战场。根据 SemiAnalysis 的数据中心行业模型,AWS 在 2025、2026 和 2027 年将建设比任何竞争对手都多的容量。
AWS 的策略非常激进。公司签订了数十亿美元的电力购买协议(PPA),与 Talen、Vistra、NiSource 等独立电力生产商合作,确保能源供应。在 AI 基础设施领域,电力供应已经成为比 GPU 供应更关键的瓶颈。理解这一点的云服务商,才能在这个受限的环境中赢得市场份额。
AWS 还在推出新的数据中心设计,采用更高的模块化和预制化程度,进一步加速部署速度。在印第安纳州和密西西比州,AWS 正在以惊人的速度建设接近 2GW 的容量。
Microsoft 的情况则不太乐观。公司经历了长达一年的数据中心建设暂停,这显著降低了 2027 年的容量预测。在威斯康星州的大规模 AI 集群建设进度缓慢,与 AWS 的闪电速度形成鲜明对比。
更关键的是容量分配问题。Microsoft 的大量 AI 算力被 OpenAI 的长期合同锁定。OpenAI 的积压订单规模是 Azure 年收入的 2.5 倍。这意味着 Microsoft 可以服务外部客户的容量实际上比账面数字要少得多。
为了弥补容量不足,Microsoft 不得不从 Coreweave 等新兴云服务商那里租用容量,但这种做法成本更高,会侵蚀利润率优势。
Google Cloud 的情况比较特殊。公司在最近一个季度的收入增长超过 60%,利润率也创下历史新高。但 SemiAnalysis 认为这种利润率增长是一种“假象”,更像是“EBTIT”(Earnings Before Training, Interest and Taxes,即不计入训练成本、利息和税收的利润)。
根据 Google 的财报,“Alphabet 层面活动”主要反映共享的 AI 研究和开发支出,在 2026 年第一季度达到 54 亿美元,而 2025 年同期为 30 亿美元。这意味着年化超过 100 亿美元的成本被计入了 Alphabet 层面,而不是 Google Cloud。所有 Gemini API 的收入都流向 Google Cloud,享受高于平均水平的利润率,但训练成本却在别处。
如果将这些成本合理分配到 Google Cloud,其利润率表现就不会那么亮眼了。
Microsoft-OpenAI 关系的微妙变化
Microsoft 与 OpenAI 的关系正在发生微妙的变化。最初,这是一个独家的 IP 合作关系,Microsoft 是 OpenAI 模型的唯一企业分发渠道。但现在,情况已经不同了。
从 Microsoft 的角度看,公司已经转向真正的多模型平台策略。现在客户可以在 Azure 上使用 Anthropic、Grok、DeepSeek 等多家公司的模型。这个转变的背景很复杂,涉及 GPU 容量、财务考量等多个因素。
更重要的是,Microsoft 的核心产品实际上并不依赖特定的模型。GitHub Copilot 和 Office Copilot 本质上是产品层,底层模型是可以替换的。GitHub Copilot 不关心使用的是 OpenAI 的 Codex、Anthropic 的 Claude 还是 Google 的 Gemini,因为模型只是一个可配置的组件,产品的价值在于与 GitHub 或 Office 365 生态系统的深度整合。
OpenAI 的 IP 优势确实让 Microsoft 能够更快地迭代,因为不仅是模型本身,相关的技术和工程经验也是 IP 的一部分。但这并不意味着 Microsoft 被锁定在 OpenAI 上。
从 OpenAI 的角度看,与 Microsoft 的关系主要体现在训练基础设施上。Microsoft 与 OpenAI、Nvidia、AMD 等公司共同设计和建设了大规模训练集群,这种深度的技术合作确实为 OpenAI 提供了优势。
但 OpenAI 最近的多云策略正在改变这个格局。公司开始与 Oracle、Cerebras 等多家云服务商合作,不再局限于 Microsoft。这种“到处合作”的策略虽然能够获得更多的算力资源,但也削弱了与 Microsoft 独家合作的价值。
对于推理业务和 Copilot 产品,OpenAI 的重要性实际上没有那么大。这些产品可以使用任何模型,选择权在 Microsoft 手中。
这种关系的演变揭示了一个更深层的趋势:在 AI 基础设施领域,独家合作的价值正在下降,平台能力和生态系统整合变得更加重要。
模型竞争的终局
AI 模型之间的差异正在快速缩小。在不同的维度上,各家模型都有自己的优势。但更重要的是进展速度。原本预计需要一到两年才能实现的进步,现在三到六个月就能完成。这种加速意味着,在未来两年内,对于常见的使用场景,各家模型的质量将会非常接近。
以编程场景为例,目前所有主流的代码助手都能完成相当不错的工作。虽然在一些边缘情况和特殊场景下还有差异,但对于主流编程语言和常见任务,差距正在快速缩小。预计在一年左右的时间内,这个场景将基本“解决”。
当模型质量趋同后,会发生什么?首先是价格压力。模型商品化后,定价权会大幅下降。其次,竞争的焦点会向价值链上游转移,转向生态系统、集成能力、企业支持等方面。
这种趋势在历史上并不罕见。当年视频处理技术的发展也经历了类似的过程:最初硬件性能是关键瓶颈,各家厂商竞相提升处理能力;当硬件性能达到“足够好”的水平后,竞争转向了软件优化、生态系统和用户体验。
在 AI 领域,这个转变正在发生。模型本身会变成基础设施,就像今天的数据库或操作系统一样。真正的价值会体现在如何使用这些模型,如何将它们整合到具体的业务流程中,如何确保它们可靠、安全、合规地运行。
企业 AI 部署的真实图景
企业市场的护城河并不在模型本身,而在平台能力。这是一个容易被忽视但极其重要的洞察。
企业客户在选择 AI 服务时,模型质量只是考量因素之一,而且往往不是最重要的。更关键的是:我的数据如何处理?是否符合 GDPR 等法规?服务商会收集我的数据吗?这些数据会用于训练模型吗?
早期 ChatGPT 作为消费者产品时,会收集用户数据。这在企业市场引起了很大的担忧。OpenAI 后来花了很大力气澄清,通过 API 使用时,数据的处理方式是不同的,不会被用于训练。但这种信任的建立需要时间。
Azure OpenAI Service 的优势正是在这里。对于已经将数据资产放在 Azure 上的企业客户,使用 Azure OpenAI Service 可以获得企业级的保障。数据有引力,在不同平台之间迁移数据的成本很高。如果只是做简单的聊天,上传一个文件还可以接受,但对于需要与现有数据资产深度整合的 agentic 工作负载,数据的位置就变得至关重要。
Agent 的兴起进一步强化了这个趋势。如果 Agent 要成为你的“同事”,那么身份认证、权限管理、审计日志这些企业 IT 的基本要求就都要满足。Agent 需要有身份,需要明确它能访问哪些资源,需要能够审计它的所有操作,需要能够评估它的行为是否符合企业政策。
更进一步的问题是:当有新模型发布时怎么办?Agent 框架通常是模型无关的,理论上可以切换底层模型。但问题是,新模型虽然可能更强,但也可能在某些方面表现不同。企业需要有评估框架来测试新模型,确保切换后不会导致功能退化。但 AI 的输出是概率性的,如何建立可靠的测试体系是一个难题。
这些复杂性意味着,真正的企业级 AI 部署需要的不仅是一个好的模型,而是一整套平台能力。这就是为什么 Azure、AWS、Google Cloud 这些大型云平台有优势,因为它们可以提供完整的解决方案。
商业模式的深层逻辑
理解 AI 云服务的商业模式,需要区分企业市场和消费者市场。
在企业市场,利润空间其实很大。企业客户支付的价格与实际的成本之间有相当大的差距。而且成本还在持续下降:硬件在进步,软件运行时在优化,Agent 循环在改进。每一层的优化都在降低实际成本。
这意味着云服务商有很大的定价灵活性。为了争夺客户,它们可以提供大幅折扣。这在云计算市场已经是常见做法,Google Cloud 为了从 Azure 抢客户,经常给出非常优惠的价格。
但企业客户对价格的敏感度其实没有那么高,至少不是决定性因素。它们更关心的是任务能否可靠完成,新版本会不会破坏现有功能,是否有足够的企业支持。如果这些问题都解决了,而且已经在某个平台上建立了完整的工作流,那么为了省一点钱而迁移的动力并不强。
推理成本已经在下降,而且随着新模型的发布,价格还在继续降低。企业客户对此并没有太大压力。真正可能成为问题的是 Agent 工作负载的 token 消耗。当 Agent 需要进行复杂的推理链,或者陷入循环时,token 消耗可能会很大。一些企业已经开始考虑给 Agent 设置 token 预算,限制单个任务的最大消耗。
消费者市场则完全不同。消费者 AI 服务很难直接盈利,必须依赖广告支持。ChatGPT 尝试过一些电商功能,但效果并不理想,幻觉问题仍然很严重。免费用户的推理成本是一个沉重的负担。
这就是为什么 OpenAI 的财务状况一直备受关注。公司有大量的免费用户,这些用户产生的推理成本很高,但不产生收入。付费用户虽然带来收入,但相比企业客户,单价要低得多。
Anthropic 的情况好一些,因为它的收入主要来自 API 和企业客户,消费者业务占比相对较小。这也是为什么 Anthropic 能够在 2026 年第二季度实现运营利润(调整股权激励后),而 OpenAI 还在亏损。
从利润率的角度看,不同的业务模式差异巨大。传统的 IaaS 业务,利润率受到硬件折旧、电力成本、数据中心运营费用的挤压。Bedrock 这样的 TaaS 业务,利润率可以达到 55%。这种差异不是小幅度的优化,而是商业模式的本质不同。
Anthropic 推理业务毛利率的快速提升也很说明问题。从 2024 年的负 94%,到 2025 年的 38%,再到 2026 年的 60% 以上,这种改善速度远超预期。背后的驱动力是多方面的:模型效率提升、硬件优化、规模效应、定价策略调整等等。
这些数据揭示了一个关键洞察:在 AI 领域,商业模式的选择可能比技术优势更重要。拥有最好的模型不一定能赚钱,但找到合适的商业模式,即使技术上不是最领先的,也可能获得很好的财务回报。
知识星球
对半导体和AI产业交流,可以加下面微信,请备注姓名和所在行业。







