Token导航 LogoToken导航TokenDH.com

智能电力化:推理开始像电力一样运转

更新时间 2026-09-03来源 AIGC从0到1正文 4370字阅读约 14分钟

8 月 31 日,Silicon Data 的有效 LLM token 价格指数降到每百万 token 0.97 美元。它在 5 月底还是约 2.07 美元,三个月跌去一半有余。这个指数不是模型厂商贴在官网上的标价,而是把实际使用、缓存、不同模型的流量结构揉在一起后的有效价格。

硬件和能源,则完全相反。

Dell 9 月 1 日披露,当季 AI 服务器订单达到 609 亿美元,AI 优化服务器收入 164 亿美元,积压订单更是到了 950 亿美元。同一时间,HBM、变压器、冷却设备和并网容量都在变得更难拿到。

一边是“智能”越来越便宜,一边是生产智能的工厂越来越贵。正在发生的产业变化:推理服务开始像电力一样,被生产、计量、调度和结算。

更准确地说,是推理开始出现公用事业经济学:单价下降、按量计费、需求弹性、跨供应商调度、容量约束,以及围绕基础设施展开的排队和争夺。


一、便宜的智能,开始自己给自己找活

真正重要的问题不是每百万 token 便宜了多少,而是:价格下降以后,谁会多买,能多买多少。

OpenRouter 今年夏天做过一场很接近天然实验的促销。7 月 27 日到 8 月 14 日,Terra 和 Luna 两个模型被大幅折扣。折扣期间,Terra 的日 token 使用量增长了 5.6 倍,Luna 增长 13.8 倍;没有同期打折的 Sol,使用量只小幅增长约 1.1 倍。

更有意思的是,Terra 和 Luna 的 token 份额从 0.7% 升到 7.8%,其中约四分之三来自其他实验室模型,而不是 OpenAI 自家产品互相替代。

这不等于“杰文斯悖论已经被严格证明”。数据来自一个网关平台,促销也不等于整个市场。

但它足够说明一件事:价格不是只在减少账单,它会创造新的调用行为。

原本不值得跑的工作流开始跑了。以前只让模型回答一次,现在多问几轮;以前只让它写一个方案,现在让它写、测、改、复盘;以前需要人点一下的任务,开始放到后台常驻;Agent 之间也会互相调用。

便宜的智能开始自己给自己找活。对很多任务来说,单位成本下降不是需求的终点,反而是需求真正开始的阈值。

二、买 token 的人,正在从人变成机器

2024 年到 2025 年,典型的 AI 买家还是人。

他会在意 ChatGPT、Claude、Gemini 哪个更聪明;会看月费是 20 美元还是 200 美元;使用上限主要由他的工作时间和注意力决定。模型便宜 30%,不太可能让他一天多聊十倍。

现在,越来越重要的边际买家是软件 Agent。

它不在乎 logo;它可以 24 小时运行;一次任务里可以调用模型几十次;它会因为价格变化自动换供应商,也会把一部分环节从贵模型迁到便宜模型。

OpenAI 自己给出的使用逻辑已经很典型:更强的模型负责消除不确定性、制定计划;更便宜的模型负责执行、跑测试、处理后台自动化。

这意味着,未来很多 AI 产品的核心问题,不再是“我该选哪个最强模型”,而是:

在成功率、延迟和安全性满足要求的前提下,怎样用最低成本完成一次任务?

模型选择开始像云资源调度。

哪里值得调用最贵的能力?哪里应该切到 Flash?哪些上下文值得缓存?失败后是重试、降级,还是切换供应商?这些问题以前属于资深工程师的经验,现在会变成产品和基础设施的日常能力。

OpenRouter 所说的 Agent token 超过 human token,也应该放在这个意义上理解。说明,在 API 和开发者市场,机器工作负载已经开始重塑边际需求。

人类的注意力有限,机器的调用次数没有那么强的上限。

三、市场已经裂成三层

第一层,是普通推理。Flash 模型、开放权重模型、Agent 的高频执行环节,都在快速通缩。这里竞争最激烈,模型之间越来越容易替换。

第二层,是稀缺能力。最难的科学问题、长时复杂代码、关键网络安全任务,依然能维持高价,甚至不再是“多少钱”的问题,而是“能不能给你用”。

第三层,是物理生产要素:电、HBM、GPU、网络、变压器、冷却、土地和并网容量。

第一层在降价,第三层却在涨价。

模型层的有效能力供给,对许多普通任务已经没有那么稀缺;但一块 GPU 不是插在空气里就能工作。

NVIDIA、Dell、云厂商和 neocloud 争夺的,不只是芯片,而是一整套“能持续产出 token 的物理能力”:有多少功率能接入,有没有足够 HBM,网络能不能承受高频推理,冷却能不能顶住密度,电网什么时候能真正送电。

所以,第一阶段的问题是“有没有 GPU”。

现在的问题越来越像:“这块 GPU 有没有电可以插。”

四、700GW,不是利多数据,反而是更深的信号

美国电网里出现的“幽灵负荷”,特别值得注意。

Reuters 9 月 1 日的一项调查显示,美国中部、中大西洋和南部一些区域,超大型用电户提出的电力申请已经超过 700GW;得州的数据中心及其他大型用户申请,则从 2023 年约 48GW 跳升到超过 474GW。

宾夕法尼亚上百个数据中心提案中,真正申请许可的只有约 20 个。得州也开始冻结部分新的数据中心电网连接,并重新审查项目计划。

这是“智能电力化”更成熟的信号。

因为传统公用事业市场本来就会遇到这些问题:有人为了抢接入资格提前排队;有人多头申请;有人占着容量不建设;电网必须区分纸面需求和真实负荷,要求保证金、工期承诺和更严格的接入条件。

如果 AI 只是一个短期热点,市场里只会有采购和炒作。

当它开始碰到容量预留、接网排队、项目去重和电力成本转嫁,它就已经进入了基础设施经济学。

真正稀缺的不是 PowerPoint 上的 GW,而是能在约定时间内实际送电的 MW。

五、AI 产业开始需要自己的“电网”

模型厂商过去希望用户直接使用自己家的能力。

现在,越来越多的使用场景会经由中间层发生:一个应用接入多个模型供应商,根据价格、延迟、地区、上下文长度、缓存命中率和任务表现动态选择。

这也是 Stripe 收购 OpenRouter 最值得研究的地方。参见Stripe 为什么盯上模型路由:AI 进入“智能采购”时代

Stripe 看中的,是 token 逐渐成为机器之间的交易单位以后,谁来负责计量、路由、预算、结算和故障切换。

它更像电网调度、电表和支付清算的混合体。

对用户来说,它记录花了多少钱;对 Agent 来说,它决定任务该走哪条路径;对模型厂商来说,它会把机器工作负载重新分配给最合适的供给方。

这层能力会越来越值钱,因为模型不再只有一个答案。

对一个 Agent 而言,最好的模型未必是全程最强的那个。一个任务可能由前沿模型先做规划,开放模型做批量执行,再用更轻的模型审核格式或分类。缓存命中时,甚至没必要重新把请求送进模型。

这就是为什么 token 不只是一种价格单位,也逐渐是一种调度单位。

六、但 token 不是 kWh

“智能像电力”的类比很有传播力,也有明确边界。

一枚 token 不等于一度电。

不同模型生成同样长度的回答,完成任务的成功率可能差很多;同一个问题在一个模型上需要一千 token,在另一个模型上可能需要五千。fresh token 和 cached token 的物理成本也不同。

更重要的是,电力被消耗后就消失了,智能产物却可以被复用。

代码可以重复运行,报告可以反复阅读,embedding 可以复用,模型权重可以自建,缓存可以直接命中。开放权重模型甚至让用户获得了某种“自建电厂”的可能性。

还有一层差异更根本。

某些最前沿模型的稀缺,不来自算力成本,而来自能力、法律和安全边界。对普通任务,模型价格可以像工业品一样向下走;对具备高风险网络能力、敏感科研能力的模型,访问权限本身会成为一种配给。

电力没有“危险的千瓦时”。

智能有。

所以,未来真正值得看的指标,不会停在 tokens/watt。

它更可能变成:

每焦耳电,换来了多少被验证的有效任务。
每美元推理成本,换来了多少可交付的工作结果。

token 是早期的计量单位,但不一定是最终的生产率单位。


七、钱会从“模型冠军”流向哪里

模型排行榜第一,和利润池最大,未来会越来越像两回事。

普通推理不断通缩后,价值不会凭空消失,只会迁移。

一部分会落到带电容量。土地本身不够稀缺,真正难的是“土地 + 并网 + 变压器 + 冷却 + 机房 + 融资”这套组合。

一部分会落到 HBM、内存带宽和网络。推理,尤其是高并发推理,不只是 FLOPS 问题,越来越是数据移动问题。

一部分会落到路由和结算。谁能在几十个模型、多个云和不同地区之间做动态选择,谁就有机会拿到“调度租”。

还有一部分,会留在受监管的关键能力上。普通模型的能力垄断期在缩短,但高风险、高可靠性、高合规要求的能力,仍然可能被限制访问,并形成新的稀缺租。

这对中国开放模型尤其有意思。

它们最现实的机会,成为机器工作负载的默认执行层。大量 Agent 不需要每一步都调用最强模型,它们需要的是可部署、可路由、足够便宜、足够稳定的执行能力。

这会是一个巨大但不那么显眼的位置。

八、这不是终局,甚至还可能被证伪

“推理公用事业化”现在是一个很强的判断,还不是一个完成的事实。

至少有三种情况,会让这个命题明显变弱。

第一,价格下降以后,稳定付费用户的 token 使用量并没有继续增长,低价模型份额也回落。那说明今年夏天可能只是一次促销和模型周期,而不是结构性需求弹性。

第二,Agent token 被证明大部分只是上下文重复、缓存流量、失败重跑和无效自我对话。那“机器成为新买家”就会变成一个漂亮但空心的说法。

第三,电网排队在保证金和真实性审核后大面积消失,Dell 等公司的积压订单出现系统性取消,HBM 与变压器的交付周期突然回落。那今天看到的物理紧缺,就更接近资本周期里的重复预订。

所以,现在最该盯住的是三条曲线能不能继续闭环:

单位智能成本下降;
机器工作负载增长;
物理容量仍然成为约束。

如果这三件事继续同时发生,AI 行业的资本配置方式会变。

过去,大家围绕“谁能训练出最强模型”下注。

下一阶段,真正重要的问题会变成:谁能以最低的系统成本,把电、算力、模型和任务接起来;谁能在有限的功率和带宽里,做出最多有效工作;谁又能把一枚越来越便宜的 token,变成一次真正完成的任务。

到那个时候,推理才算真正开始像电力一样运转。


>/作者:王零壹,920.org(AI Research Institute)创始人,港大AIBT研究生,前上市公司 CMO。长期研究 AI 产品、Agent 架构与商业增长,并持续观察技术变迁如何重塑人的工作、判断与生活。

*著有《AIGC从0到1》系列丛书、及东方寓言小说《飞将军》;

*善于洞察先机,中文互联网第1个意识到OpenClaw范式价值的人(1月26日);

关注我,一起AIGC从0到1~

920.org|AI Research Institute
How does experience become capability?
920.org 是一家 AI 研究机构,研究 AI 系统如何将经验转化为持久、可迁移的能力。我们通过数据、实验、可执行环境与评估,研究能力如何形成、能否保持,以及能否迁移到新的任务与环境。
文章标签算力
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多