Token导航 LogoToken导航TokenDH.com

阶跃发布Step 5 Preview:600B MoE瞄准长程Agent,10月将开源

更新时间 2026-09-20来源 腾讯科技正文 2266字阅读约 8分钟3 张图片

图片

文|晓静

编辑|徐青阳

9月20日,阶跃星辰发布新一代旗舰基座模型Step 5 Preview。模型采用稀疏混合专家架构,总参数量600B、每个Token激活约27B参数,支持100万Token上下文及文本、图像输入,重点面向AI编程、软件工程、金融分析和专业知识工作等复杂Agent场景。阶跃星辰表示,模型计划于10月15日开放权重。

第三方评测机构Artificial Analysis给Step 5 Preview的综合智能指数为44分。阶跃星辰称,这一成绩进入全球开源模型前三。

在能力、成本、效率与场景覆盖之间寻求最大化平衡,是 Step 5 Preview 的核心卖点。模型面向真实世界的智能体任务,其定位是可持续处理复杂任务的主力工作模型。

图片

01

92层“窄而深”架构

相比主要增加网络宽度,Step 5 Preview选择了“窄而深”的设计,共包含92层Transformer。

复杂Agent任务通常需要连续搜索、执行代码和调用外部工具,工具返回的信息会形成很长的Prefill,即模型正式生成内容前处理输入上下文的阶段。阶跃星辰认为,增加模型深度,可以为长Prefill中的隐式多跳推理提供更长的信息传播路径。

深层网络也更容易出现数值爆炸和梯度尖峰。官方称,团队针对训练稳定性进行了专门优化,但暂未披露具体的归一化、残差结构及相关对照实验。

02

Sparse GQA降低百万上下文开销

面对100万Token上下文,Step 5 Preview引入Sparse GQA,通过稀疏索引选择与当前任务相关的历史信息,减少实际进入注意力计算的Token数量。

算法层面的稀疏并不必然带来同等幅度的速度提升。Indexer开销、分散的数据读取和较低的GPU利用率,都可能抵消理论收益。为此,Step 5 Preview进一步采用Block-wise Token Merging,将部分Token合并后执行索引与选择。官方称,这一方法把Indexer和Top-k Selection环节的成本降低至原来的八分之一,同时合并相邻Token高度重叠的Top-k结果,减少碎片化计算。

03

模型参与下一轮数据生产

Step 5 Preview还被用于构建自身后续迭代所需的训练数据。这里的“自进化”仍处在人类设定的训练体系内:专家负责制定原则和关键判断,确定性操作被封装为工具,Agent承担任务编排、跨步骤决策和部分数据生成。

研发团队发现,直接让Agent生成任务容易导致任务趋同,能力更强的模型还可能寻找评测漏洞,表面完成任务却没有解决真实问题。为此,阶跃星辰建立了统一上下文层和结构化知识空间,通过显式信号控制任务难度与多样性,并把Anti-hacking审计嵌入数据流程。

官方称,这套体系已构建出百万级可验证高难任务,覆盖科学推理、软件工程、机器学习研发和专业工作。Agent在生产数据时留下的轨迹与反馈,也被用作训练下一代模型学习数据生产方法的语料。

04

长程强化学习提速超过三倍

长程Agent训练的一项难题是训练与推理的一致性。MoE模型会动态选择不同专家,细微的数值差异可能改变路由结果,并随92层网络不断累积。

Step 5 Preview在严格在线策略训练中实现了训练与推理的bit-wise对齐:使用确定性算子统一两侧实现,并通过树状归约消除张量并行度对计算结果的影响。官方披露,该方案增加的端到端开销低于10%;在异步训练中,通过复用推理状态,将训练与推理的logprob偏差控制在1e-2以内。

模型还采用负载感知调度、MTP-3投机解码、FP8 MoE、FP8 KV量化感知训练、跨机专家并行和KV Cache卸载等技术。官方称,这些方法使长程强化学习端到端加速超过三倍。覆盖样本完整生命周期的账本机制,则把训练链路中的样本丢失率控制在1%以下。

此外,Step 5 Preview会在Token预算接近上限时主动管理上下文,并将这一能力纳入强化学习。预训练Critic负责Token级信用分配,格式错误和奖励投机等短期问题则在轮次级单独处罚,避免一次错误影响整条任务轨迹。

图片图:Step 5 Preview在Artificial Analysis榜单中的智能水平与任务成本。

Artificial Analysis数据显示,Step 5 Preview的API输入、输出价格分别为每百万Token 1美元和2.7美元,输出速度约为每秒100 Token。在其综合指数口径下,模型平均单任务成本约为0.71美元,Claude Opus 5最高推理档位约为2.03美元。

因此,官方所称“单任务成本为Claude Opus 5的1/8”应限定在其选取的任务和配置中。Step 5 Preview完成整套综合评测生成了约1.60亿输出Token,高于相近价位模型9200万Token的中位数,较低单价可能被更长的推理过程部分抵消。

从已披露信息看,Step 5 Preview的技术重点已经从单轮问答转向完整Agent运行过程,涵盖长上下文、多步规划、工具调用、训练稳定性和数据生产。10月开源后,92层模型的部署门槛、Sparse GQA的实际加速幅度,以及开放权重版本能否复现API表现,将成为进一步观察的重点。

阶跃认为,过去大模型 Scaling 的核心,是用更多计算换取更强智能;但随着模型规模扩大、智能体任务复杂度提升,计算成本也在快速攀升。因此下一阶段模型 Scaling 的关键,是提升计算转化为智能的效率。从 Step 3.5 Flash、Step 3.7 Flash 到 Step 5 Preview,阶跃连续三代基座模型都延续了对这一问题的探索。

资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多