大家好,我是袋鼠帝
几个月前我写过一篇阶跃 Step 3.7 Flash 的文章,那次是把它接进 Claude Code 当眼睛用。
当时我对它的感受是:快、耐用、看图看视频很准,但真要干复杂点的活,还是得交给 Codex+GPT-5.5(那时候还是5.5)。
所以这次我参与了阶跃新一代旗舰模型(Step 5 Preview)的内测,我非常好奇,这个模型的版本直接跳过了中间的4,能力到底有多强。
对了,阶跃Step 5 Preview这次开源时间是:10 月 15 日正式开源!现在已经可以通过产品和 API 体验了。

ok,我们先看看跑分:
Step 5 Preview 在 Artificial Analysis 获得了 44 分,跟 Kimi K3、Grok 4.6 是同一个分数,比 GLM-5.3 差一分,从这个跑分看起来在国产模型中跟 GLM-5.3、Kimi K3 是一档。
而三个月前 Step 3.7 Flash 在同一张榜上大概是 19 分。看来直接跨过4的版本号,提升确实非常大。

600B 总参数、27B 激活,1M 上下文,支持图片和视频输入。
不过榜单我一向只当参考,是骡子是马还得拉出来溜溜。
环境还是跟上次一样接进 Claude Code,方便对比。
这次我一口气丢了五种极具挑战的项目给它。玩法多样,从城市3D网站,到把我自己的 Mac 软件移植成 Windows 版,最长的一个跑了快三个小时。。
昆明是我现在住的城市,所以第一个任务,我想试试把昆明用 three.js 搬进 web 里。
先看效果:
该有的地标建筑都有,日夜变化也有,最重要的是每个建筑的建模跟真实的建筑挺像的。
做这个 case 的时候,我提交了该有的建筑照片和地理位置:

然后它就根据我给的信息,加上自己查阅的资料,去刻画具体的位置和外观。视频里能看到还原度还是不错的。
在文档遵循这块它做得很好,能一步一步按 PRD 开发,不脱离 PRD。
我们知道很多 agent 做着做着就会脱离 PRD 自己发挥,但它不会,很守规矩。


按步骤来,一步是一步,这做得确实很细节。

不过我必须提一嘴:这个 case 它跑了差不多整整 3 个小时,中间没断连,一直在吭哧吭哧干。最终才得到这样不错的效果。可以说是模型界的劳模了。

后来看官宣,我发现他们还做了一个更狠的测试:
给 Step 5 Preview 24 小时,让它在一张 H100 上优化 GPU Kernel。它自己写、自己跑,再根据结果继续改,约 22 小时后做到了 508 TFLOPS。

这张图来自阶跃官方,每个模型都跑了 4 次,取最好的一次。
我觉得有意思的地方是,它跑到后面还在不断刷新自己的最好成绩。这才是长任务值得期待的地方,时间花下去了,结果也在变好。
Ta 是我自己做的一款AI原生截图工具,在保留所有基本截图功能的前提下,增加了一系列AI能力。我现在每天用的截图工具就是Ta。

问题是它只有 Mac 版,没有 Windows 版。
借这次机会,我让 Step 5 Preview 来做移植。最终效果如下:
这个任务最让我震惊的地方,是我同时多开了好几个 agent,居然每一个都跑了超过一个小时,amazing

它还有个习惯:每开发完一个阶段,就把文档更新一遍。
多个 agent 并行的时候这点很关键,其他 agent 读到的永远是最新的信息,不会拿着旧文档瞎搞。

碰到项目里我不知道的内容,问它一句,它能用很简单的话给我解释清楚,让我明白自己到底在做什么。

给出了详细的转换文档,1847行,把架构,转换策略全部都详细描述清楚,为后续工程开发提供指导。

总的来说,做的不错,我已经把这版Windows版提交到Ta的GitHub仓库了~
大家在手机上 Vibe Coding 的时候是不是很不方便看markdown文件?
所以这次我让它做了一款专门给手机看 md 和 html 的产品,叫墨读。

效果请看VCR:
一开始Step 5 Preview给出了一份非常详细的新老阅读器改造方案,把墨读需要什么样的适配方案写得明明白白。

最棒的一点是,它从来不靠猜。
碰到不确定的地方,它会先去真实验证,看起来合理但没验证过的答案它不给。
我想这应该是印在它出场设置里的东西,一个好的模型不应该尝试去猜答案。

复刻一款广告小游戏,就是刷视频经常弹出来的那种:
主角带着一队士兵往前冲,穿过不同的门人数会加减,最后跟敌人拼人数(大家应该看到过吧🤔)。
游戏逻辑和场景都在,不说百分百,做到 80% 是有的,剩下就需要慢慢优化了。
子弹和士兵是分开渲染的,没有偷懒画在一起。

在数学和工程的应用上它做的也很到位算准了敌人和主角人数相对数量,穿过门之后士兵人数变化,等难处理的逻辑人物

写完它也没有直接跟我说"做好了",先自己拉了个临时页面把产物跑起来,对照预期看效果对不对。

这个任务非常困难,而且很折腾:
在网页里做一个虚拟机械臂,再接入一个 AI 模型,让 AI 控制机械臂画画。最终接进去的测试模型是 GLM-5.3-Flash。
说实话,这机械臂的建模不太好。但 AI 是接进去了,机械臂也真的画出了月亮。


但这个项目它整整做了 158 项测试,恐怖如斯。

改文档的时候也一样,一项一项去比对 PRD,以基准为主,不自己加戏。

代价是这个 case 跑了一个多小时。

如果给它再多跑一下,估计得到的效果会更好。
关于价格很多时候评论区都会问到价格,索性这次一并说了。
Step 5 Preview 在国内开放平台的 API 价格,按每百万 tokens 算,输入 7 元,输出 20 元,命中缓存的输入只要 0.35 元,比未命中便宜 95%。这个价格还是比较便宜的了。
Artificial Analysis 这里有个对比:跑完一道智能指数测试题,Step 5 Preview 平均花 $0.71。这个数大概是 GLM-5.3 和 Kimi K3 的 35%,Claude Opus 5 的 12.5%。

说实话,城市3D Web那个项目跑了接近 3 小时,要是换成 Claude Opus 5 来跑,账单我是不太敢看的。。
三个月前参加腾讯云 AI 峰会,被采访问到今年的 Agent 跟去年有什么不一样,我说的是"干活越来越稳了,跑任务所需的时间也更长了"。当时只是体感,但后来我发现,居然一直有人在正经统计这个事儿。
METR 这个机构从 2019 年起就在测一个指标:AI 能独立完成的任务,换成人类专家要干多久
2019 年的 GPT-2,人花 2 秒钟的活它能干,再长就不行了。2025 年初的 o3,人要干将近 2 小时的活它能干。今年二三月他们测最强的那批模型,人要干两个整工作日的活,它也能一口气干完,题库都快被刷光了。。。
从 2 秒到 2 天,只用了 7 年,而且最近一年多是每 3 个月翻一倍。这个指标量的从头到尾都是"能不能交付结果",跟速度没关系。
今年 9 月 15 号 Mozilla 出的《State of Open Source AI》报告里有个数据:美国闭源前沿模型和中国最好的开源模型,能力差距只剩 4.4 个月。
这些研究让我更有体感的一点是:Agent 能接手的活,正在变得更长、更复杂。我这次让 Step 5 Preview 连着跑了接近 3 小时,最后交出了城市3D网站,也算是亲眼看到了这种变化。
不得不说,国产模型这一年是真的追上来了,而且还几乎都是开源的。
再说价格。a16z 在 2024 年做过一个统计,同等能力的模型,推理成本每年降 10 倍左右,比 PC 时代算力降价、互联网泡沫那几年带宽降价都快。
回想了一下,早年上网是按小时收费的,上线之前得先想好要查什么,查完赶紧断开。
后来宽带包月了,才敢肆无忌惮的随便在网上冲浪。也因此诞生了很多现象级的应用。
当价格降到某个临界点以下,就会产生变革,互联网是这样,我觉得AI可能也会有这么一天。
上次写 Step 3.7 Flash 的时候我说过,时间大于金钱,用钱买时间一定划算。
但光快还不行,得控制成本的前提下,交付有质量的结果,这次Step 5 Preview做到了
用钱买交付结果是更划算的事情。不过,Step 5 Preview速度可能没那么快,但是你可以让它上夜班呀
。
睡一觉起来收菜,也很爽~
我是袋鼠帝,一个致力于帮你把AI变成生产力的博主。我们下期见~







