9 月 20 日,阶跃星辰发布新一代旗舰基座模型 Step 5 Preview。它在 Artificial Analysis 智能指数上拿到 44 分,挤进全球开源模型前三,单任务成本只有 Claude Opus 5 的八分之一。
两个数字都很漂亮,可口径不一样。44 分是独立榜单给的,八分之一是阶跃自己算的。并排放在一起读,很容易读成同一件事。
01 600B 参数,每次只动 27B
Step 5 Preview 走的是稀疏 MoE 架构,总参数 600B,每生成一个词元只激活其中 27B,约占总量的 4.5%。上下文窗口 100 万词元,原生支持文本与图片输入。
这个比例的意思很直白:参数储备留得足,单次推理的算力账单却压在 27B 这一档。阶跃管这叫“把帕累托前沿往外推”:同样的成本,换更强的智能。
同一条路上,国产模型各有走法。DeepSeek V4.1 Flash 是 552B 配 8B 到 16B 的非对称激活,智谱 GLM-5.3-Flash 是 320B 配 18B。共同点只有一个:把每个词元要动的算力压进两位数。

02 前三这个位次,得拆开看
AA 智能指数那一栏,Step 5 Preview 是 44 分,在 200 个参评模型里排第 24 位。它与 Kimi K3 Max 打平,比智谱 GLM-5.3 低 1 分。
榜首的 Claude Fable 5.1 和 GPT-6 Astra 站在 53 分。它坐进了开源阵营的前排,但离前沿还差着一截,这两句话不冲突。
分项上,金融是最露脸的一块,FrontierFinance 拿到 66.4 分;软件工程里 ProgramBench 80.5、DeepSWE v1.1 67.7;Agent 长任务 ALE-CLI 29.5 分,略高于 GLM 和 Kimi。
需要说清楚的是,这些分项里有相当一部分出自官方自测。StepCodeBench 就是阶跃自建的,覆盖 553 个代码仓库、9 类任务、33 种编程语言。拿自己的尺子量自己,分数好看是正常的。

03 便宜是真的,话多也是真的
AA 的独立评测里,藏着一组更该抄下来的数字。
跑完整套智能指数评测,Step 5 Preview 输出了 1.6 亿 token,同批模型的中位数是 9200 万,差不多是 1.7 倍。AA 的措辞是速度高于平均,但回答非常冗长。这一轮评测总花费 918.34 美元。
单价确实低。输入 1 美元、输出 2.7 美元每百万词元,国内定价 7 元和 20 元,输出单价只有榜单中位数的两成多,缓存折扣给到 95%。输出速度 99.8 词元每秒,首字延迟 2.96 秒。
低单价和多用词元本来就是一笔账的两头。真正诚实的那个数是单任务 0.71 美元,它把速度和啰嗦一起折了进去,比单看价格表可靠得多。
也得说句公道话。金融、Agent、软件工程这类硬任务上,愿意多吐词元的模型往往更能扛,长思考不总是缺点。“非常冗长”既是能力评价,也是账单,两头都得认。

04 10 月 15 日才开考
API 在发布当天就全量开放了。完整的模型权重定在 10 月 15 日开源,BF16 精度,许可证目前还没公布。
在那之前,所有成绩里都有相当比例是官方自测,独立评测只覆盖了少数几项。等权重落地、别人能自己跑起来,答案才算数。
阶跃今年 1 月由印奇挂帅,一边是软件 AI,一边是物理 AI 与智驾,这次跳过整个 Step 4.x 直接进 5。它证明的是效率这条路走得通,还不到证明能力追平前沿的时候。







