大模型真正难的地方,可能不是把第一句话说漂亮,而是在连续失败十几次之后,仍然知道下一步该做什么。
9月20日,阶跃星辰发布新一代旗舰模型 Step 5 Preview。它的关键词不是单纯的“更大”,而是更长的任务、更复杂的工具调用,以及让模型在执行过程中不断调整策略。
从发布定位看,Step 5 Preview 面向的是智能体工作流,重点覆盖软件工程、编程、专业知识工作和金融场景。
测试“能不能做完”
阶跃星辰给出的一个测试场景,是让模型在 NVIDIA H100 上持续优化推理内核。
这不是写一段代码就结束。模型需要反复修改、编译、运行,再根据结果继续调整。整个测试持续24小时,最终记录到的最高性能为508 TFLOPS。
这个过程更接近真实的软件工程:问题不会一次解决,工具也不会每次都给出理想反馈。模型要记住此前尝试过什么,也要判断下一次应该从哪里改起。
在另一项实验中,Step 5 Preview 被用于自动构造训练数据,并对 Qwen3-30B-A3B 进行后训练。模型在 AIME24 上的成绩从53.3%提升到60%。阶跃星辰称,这一结果与 Claude Opus 5 的测试结果相当,同时使用的标注器 token 更少。
这类实验的意义,不在于证明模型已经能够“自我进化”,而在于它开始参与更长的优化循环:提出方案、执行、观察反馈,再决定下一步。
6000亿参数,真正跑起来的是270亿
Step 5 Preview 采用稀疏混合专家架构,总参数量约6000亿,但每个 token 实际激活约270亿参数,同时支持百万 token 上下文和视觉输入。
这套设计的思路并不复杂:模型可以保留更大的“知识和能力池”,但每次处理任务时只调用其中一部分专家,从而控制推理成本。
不过,27B 激活参数并不等于部署门槛很低。完整权重规模、显存需求、并行部署方式,仍然会影响企业是否愿意把它放进生产环境。MoE 解决的是每一步调用多少计算资源的问题,并没有让整个模型凭空变轻。
百万 token 上下文也需要谨慎理解。它意味着模型能够装下更多代码、文档和历史记录,但“装得下”与“持续用得准”并不是一回事。对于长任务来说,模型能否在数十轮操作后保持目标不偏移,往往比上下文窗口本身更重要。
长任务仍然是另一场比赛
在阶跃星辰公布的评测中,Step 5 Preview 在 DeepSWE v1.1 上得分67.7,在 StepCodeBench 上得分49.0,在 ProgramBench 上得分80.5。
其中,StepCodeBench 的成绩高于发布页列出的 Kimi K3 和 GLM-5.3。不过,在 Terminal-Bench v4 等测试中,它与部分头部模型仍有明显差距。
这说明 Step 5 Preview 的优势并不是“所有项目都第一”,而是更集中地体现在代码修改、软件工程和长流程执行等任务上。阶跃星辰自己也提到,在最困难的长时间运行任务中,模型与前沿水平之间仍存在差距。
另外,这些成绩主要来自模型发布方公布的测试,测试设置、提示词、工具环境和评测版本都会影响结果,暂时不宜直接理解为第三方全面复测结论。
目前,Step 5 Preview 已通过阶跃星辰的产品和 API 提供使用,完整模型权重计划于10月15日开放。
接下来,开发者最关心的无非是两件事:API 实际用起来稳不稳、成本高不高;等权重开放后,社区又能不能在自己的环境里部署和调优。
对阶跃星辰来说,Step 5 Preview 的看点并不只是参数规模,而是它把模型竞争进一步推向了“持续完成复杂工作”的阶段。
聊天模型比的是回答质量,智能体模型还要面对另一组问题:任务能不能拆开,工具能不能用对,错误能不能修回来,几个小时之后还能不能记得最初的目标。
Step 5 Preview 交出的,是一份面向这场比赛的预览答卷。它已经展示出一些长任务能力,但距离稳定地替人完成复杂工作,还有不少真实环境要过。







