在杭州失眠了,三点醒来以后再也睡不着,索性起来写篇文章。
想聊聊阶跃这周发布的 Step 5 Preview,官方放出来的 Benchmark 数据看起来很不错,在 Artificial Analysis Intelligence Index 里进入了全球开源模型前三。
先说下模型的基本面。Step 5 Preview 采用 MoE 架构,总参数 600B,激活参数 27B,支持 100 万 Token 上下文,原生多模态。
600B 放在今天的旗舰模型里,其实不算特别大。所以发布那天刚看到参数的时候,我还有点纳闷。
阶跃早在 Step-2 时期就已经做过万亿参数的 MoE,怎么到了 Step 5,参数规模反而缩到了 600B?
毕竟按照过去 Scaling 最直观的逻辑,在架构、数据和训练质量差不多的情况下,模型容量继续变大,理论上还是更有机会获得更强的智能。
那阶跃为什么这一次反而没有继续往万亿参数堆?
回答这个问题,还是得看他们的官方 Release blog。我再次强调一下我的观点,所有模型的重要的信息都会以直观的方式体现在 Release blog 当中。
官方在 blog 的标题和第一段话都强调了帕累托前沿。
这个词听起来有点学术,其实很好理解。我举个例子,假设我们只看两个指标:能力和成本。
如果模型 A 比模型 B 更强,同时还更便宜,那 B 就没有什么存在价值了,因为 A 在两个维度上都更好。经济学里会说,B 被 A 支配了。
但现实里通常没这么简单。
有的模型更强,但更贵。有的模型便宜,但能力弱一点。有的模型速度快,但推理深度差一些。这时候就会出现一批模型,它们各自在某种取舍下已经做到最好。
比如:
模型 A,能力 90,成本 10。
模型 B,能力 95,成本 20。
模型 C,能力 98,成本 50。
这三个都可能在帕累托前沿上。因为你如果想从 A 提升到 B,能力变强了,但成本也上去了。想从 B 到 C,也一样。
所谓帕累托前沿,就是在当前技术条件下,你已经没办法让一个指标继续变好,同时又不牺牲其他指标。
具体到 Step 5 Preview,他们想做的,就是让模型更强的同时,尽量不牺牲效率,也不要让成本跟着大幅上涨。
多说一句,Karpathy 昨天说, Jev 大火的原因是它处于 LLM 帕累托最优曲线上的一个点。
下面这是 Step 5 Preview 的价格,基本上和 DeepSeek V4 Pro 是一个水准。
官方的 Blog 上画了一张图。
横轴是单个任务的成本,越往右越贵,而且还是对数坐标,所以往右一点,成本可能已经差了好几倍。
纵轴是 Artificial Analysis 的 Intelligence Index,越往上代表综合能力越强。
所以理论上,模型当然都希望自己出现在左上角。左上角意味着,模型能力足够强,而且成本还低。
GPT-6 Astra 和 Claude Opus 5,它们在最上面,说明能力很强,但也非常靠右,意味着单任务成本很高。
GLM-5.3 和 Kimi K3 在中间区域,能力和 Step 5 大概在一个区间,但位置比 Step 5 preview 更靠右。
同样的能力,以前可能要花 10 块钱,现在可能 3、4 块钱就能做到。
这就叫把帕累托前沿往外推。
Step 5 Preview 目前已经可以通过 API 使用,但真正释放模型权重,要等到 10 月 15 日。目前官方还没有放出特别详细的 Technical Report。
但到时候出来,我在群里给大家发下。
我同事这两天也跑了一些 Case,给大家看看。
现在行业里只要有比较重要的模型发布,我们团队基本都会烧上至少 4亿 Token 跑一轮 Case。
毕竟我们就是做这一行的,得保持手感。只看官方 Benchmark,或者看别人测评,和自己真正用起来,感受还是会有差别。
我们觉得 Step 5 Preview 的 Coding 和长程任务能力确实还是很有竞争力。
比如大家看这个前端案例。我想给我们 AI Maker Summit 大会做一个电子门票,之前的电子门票就比较土,就一个简单的二维码。
但现在做这种创意页面已经越来越不受人力限制了。既然这样,我们完全可以多花一点时间,把这些细节体验做得更好一点。
这是我在 X 上看到的一个交互。
在这个基础上,复刻为我们产品的一部分。
这个 Case,我直接把截图扔过去,口喷了自己的需求。它中间会自己理解截图里的页面结构和交互逻辑,然后写代码、打开页面、不断调试,直到把效果做出来。
一共和模型交互了三轮(提了一些优化建议),它就搞定了。
继续,又做了一个益智类游戏,极限烧脑之旅。因为它支持原生多模态,所以我也懒得自己描述需求,找了一个别人做的视频,让它理解这个视频之后,把游戏给我做出来。
大家看,这是原视频。
这个 Case 的难度除了写代码之外,它还得能够理解视频中的游戏逻辑。
比如,立方体旋转时,连线的尾部的点必须锁定在原来的屏幕位置,旋转后还能从新面继续画,不能跟着立方体旋转而改变位置。
Step 5 Preview 还顺带做了验证,说明底层逻辑确实是成立的,不只是视觉上看着差不多。
还有通关时,不只判断一笔画是否把图案连对,还要看从哪个面展开,以及展开后的角度能否和左下角目标图对齐。
同一条正确的连线,展开的方向不对,出现 90° 或 180° 偏差,也不能通关。
下面这是最后的成品,审美挺不错的。
继续,我再给大家看一个我们的后端 Case。前两天我有讲过,我正在做一个 AI 知识库的产品。
核心思路是,把我们大会过去的视频,以及 YouTube 上我长期关注的一些重要科技博主的视频都放进系统里,把这些视频的 Transcript 变成可以直接调用的 Context。
因为我们大会还是请到了非常多一线的 AI 实践者。
但没想到,周二一早醒来,发现前一天刚买的 100G 下行流量已经用尽了。
我就很纳闷,怎么能这么快呢?因为这个产品根本没有大规模推广过,只是我们的付费用户在用。
所以,吃饭之前,我让 Codex 做了下分析。它得出的结论是有人盗刷。
于是我就让它去修,结果还没开始干活,5 小时额度已经用完了。
于是,我切换到 Claude Code,接上了 Step 5 Preview 开干。大概跑了两个小时,它自己搞定了 6 个防盗措施。
点开之后,发现视频报错。截图,继续扔给模型,搞定了:
这是最终的页面:
话说阶跃这家公司和国内其他几家模型公司的思路,不太一样。其他几个模型公司仍然还是沿着 OpenAI 或者 Anthropic 的思路在前进。
而阶跃很早就开始押注 Personal Agent,他们认为 Personal Agent 最后一定要进入终端。所以这几年一直在做智能终端 Agent,从手机、汽车一路做到 PC、具身智能和 IoT。
今年甚至直接发布了自己的终端品牌 STEPX、智能体操作系统 Step AOS 和 Personal Agent Amoo。
恰好 Personal Agent 这两天突然又特别火。
Meta 9 月刚刚发布了一款产品叫 Muse,就是一个非常典型的 Personal Agent。它可以帮你发邮件、订旅行、填表、购物,甚至你关掉 App 以后,它还可以继续在云端工作。
上线不到两周,现在已经冲到了美国 App Store 免费榜第一,超过了 ChatGPT。Meta 的股价这两天也涨得非常猛。
Meta 这件事突然让我意识到,Personal Agent 可能真的要从一个概念,变成下一阶段 AI 产品竞争的主战场。
到那时候,也许阶跃这家公司过去的一些非共识判断会逐步的浮出水面。Coding Agent 之后,Personal Agent 会成为下一轮 AI 产品竞争的重点。







