Token导航 LogoToken导航

阶跃 Step 5 Preview 发布:MoE 架构与实测评价

更新时间 2026-09-24来源 AI产品阿颖正文 2978字阅读约 10分钟

在杭州失眠了,三点醒来以后再也睡不着,索性起来写篇文章。

想聊聊阶跃这周发布的 Step 5 Preview,官方放出来的 Benchmark 数据看起来很不错,在 Artificial Analysis Intelligence Index 里进入了全球开源模型前三。

先说下模型的基本面。Step 5 Preview 采用 MoE 架构,总参数 600B,激活参数 27B,支持 100 万 Token 上下文,原生多模态。

600B 放在今天的旗舰模型里,其实不算特别大。所以发布那天刚看到参数的时候,我还有点纳闷。

阶跃早在 Step-2 时期就已经做过万亿参数的 MoE,怎么到了 Step 5,参数规模反而缩到了 600B?

毕竟按照过去 Scaling 最直观的逻辑,在架构、数据和训练质量差不多的情况下,模型容量继续变大,理论上还是更有机会获得更强的智能。

那阶跃为什么这一次反而没有继续往万亿参数堆?

回答这个问题,还是得看他们的官方 Release blog。我再次强调一下我的观点,所有模型的重要的信息都会以直观的方式体现在 Release blog 当中。

官方在 blog 的标题和第一段话都强调了帕累托前沿。

这个词听起来有点学术,其实很好理解。我举个例子,假设我们只看两个指标:能力和成本。

如果模型 A 比模型 B 更强,同时还更便宜,那 B 就没有什么存在价值了,因为 A 在两个维度上都更好。经济学里会说,B 被 A 支配了。

但现实里通常没这么简单。

有的模型更强,但更贵。有的模型便宜,但能力弱一点。有的模型速度快,但推理深度差一些。这时候就会出现一批模型,它们各自在某种取舍下已经做到最好。

比如:

模型 A,能力 90,成本 10。

模型 B,能力 95,成本 20。

模型 C,能力 98,成本 50。

这三个都可能在帕累托前沿上。因为你如果想从 A 提升到 B,能力变强了,但成本也上去了。想从 B 到 C,也一样。

所谓帕累托前沿,就是在当前技术条件下,你已经没办法让一个指标继续变好,同时又不牺牲其他指标。

具体到 Step 5 Preview,他们想做的,就是让模型更强的同时,尽量不牺牲效率,也不要让成本跟着大幅上涨。

多说一句,Karpathy 昨天说, Jev 大火的原因是它处于 LLM 帕累托最优曲线上的一个点。

下面这是 Step 5 Preview 的价格,基本上和 DeepSeek V4 Pro 是一个水准。

官方的 Blog 上画了一张图。

横轴是单个任务的成本,越往右越贵,而且还是对数坐标,所以往右一点,成本可能已经差了好几倍。

纵轴是 Artificial Analysis 的 Intelligence Index,越往上代表综合能力越强。

所以理论上,模型当然都希望自己出现在左上角。左上角意味着,模型能力足够强,而且成本还低。

GPT-6 Astra 和 Claude Opus 5,它们在最上面,说明能力很强,但也非常靠右,意味着单任务成本很高。

GLM-5.3 和 Kimi K3 在中间区域,能力和 Step 5 大概在一个区间,但位置比 Step 5 preview 更靠右。

同样的能力,以前可能要花 10 块钱,现在可能 3、4 块钱就能做到。

这就叫把帕累托前沿往外推。

Step 5 Preview 目前已经可以通过 API 使用,但真正释放模型权重,要等到 10 月 15 日。目前官方还没有放出特别详细的 Technical Report。

但到时候出来,我在群里给大家发下。

我同事这两天也跑了一些 Case,给大家看看。

现在行业里只要有比较重要的模型发布,我们团队基本都会烧上至少 4亿 Token 跑一轮 Case。

毕竟我们就是做这一行的,得保持手感。只看官方 Benchmark,或者看别人测评,和自己真正用起来,感受还是会有差别。

我们觉得 Step 5 Preview 的 Coding 和长程任务能力确实还是很有竞争力。

比如大家看这个前端案例。我想给我们 AI Maker Summit 大会做一个电子门票,之前的电子门票就比较土,就一个简单的二维码。

但现在做这种创意页面已经越来越不受人力限制了。既然这样,我们完全可以多花一点时间,把这些细节体验做得更好一点。

这是我在 X 上看到的一个交互。

在这个基础上,复刻为我们产品的一部分。

这个 Case,我直接把截图扔过去,口喷了自己的需求。它中间会自己理解截图里的页面结构和交互逻辑,然后写代码、打开页面、不断调试,直到把效果做出来。

一共和模型交互了三轮(提了一些优化建议),它就搞定了。

继续,又做了一个益智类游戏,极限烧脑之旅。因为它支持原生多模态,所以我也懒得自己描述需求,找了一个别人做的视频,让它理解这个视频之后,把游戏给我做出来。

大家看,这是原视频。

这个 Case 的难度除了写代码之外,它还得能够理解视频中的游戏逻辑。

比如,立方体旋转时,连线的尾部的点必须锁定在原来的屏幕位置,旋转后还能从新面继续画,不能跟着立方体旋转而改变位置。

Step 5 Preview 还顺带做了验证,说明底层逻辑确实是成立的,不只是视觉上看着差不多。

还有通关时,不只判断一笔画是否把图案连对,还要看从哪个面展开,以及展开后的角度能否和左下角目标图对齐。

同一条正确的连线,展开的方向不对,出现 90° 或 180° 偏差,也不能通关。

下面这是最后的成品,审美挺不错的。

继续,我再给大家看一个我们的后端 Case。前两天我有讲过,我正在做一个 AI 知识库的产品。

核心思路是,把我们大会过去的视频,以及 YouTube 上我长期关注的一些重要科技博主的视频都放进系统里,把这些视频的 Transcript 变成可以直接调用的 Context。

因为我们大会还是请到了非常多一线的 AI 实践者。

但没想到,周二一早醒来,发现前一天刚买的 100G 下行流量已经用尽了。

我就很纳闷,怎么能这么快呢?因为这个产品根本没有大规模推广过,只是我们的付费用户在用。

所以,吃饭之前,我让 Codex 做了下分析。它得出的结论是有人盗刷。

于是我就让它去修,结果还没开始干活,5 小时额度已经用完了。

于是,我切换到 Claude Code,接上了 Step 5 Preview 开干。大概跑了两个小时,它自己搞定了 6 个防盗措施。

点开之后,发现视频报错。截图,继续扔给模型,搞定了:

这是最终的页面:

话说阶跃这家公司和国内其他几家模型公司的思路,不太一样。其他几个模型公司仍然还是沿着 OpenAI 或者 Anthropic 的思路在前进。

而阶跃很早就开始押注 Personal Agent,他们认为 Personal Agent 最后一定要进入终端。所以这几年一直在做智能终端 Agent,从手机、汽车一路做到 PC、具身智能和 IoT。

今年甚至直接发布了自己的终端品牌 STEPX、智能体操作系统 Step AOS 和 Personal Agent Amoo。

恰好 Personal Agent 这两天突然又特别火。

Meta 9 月刚刚发布了一款产品叫 Muse,就是一个非常典型的 Personal Agent。它可以帮你发邮件、订旅行、填表、购物,甚至你关掉 App 以后,它还可以继续在云端工作。

上线不到两周,现在已经冲到了美国 App Store 免费榜第一,超过了 ChatGPT。Meta 的股价这两天也涨得非常猛。

Meta 这件事突然让我意识到,Personal Agent 可能真的要从一个概念,变成下一阶段 AI 产品竞争的主战场。

到那时候,也许阶跃这家公司过去的一些非共识判断会逐步的浮出水面。Coding Agent 之后,Personal Agent 会成为下一轮 AI 产品竞争的重点。

文章标签AI资讯
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多