Token导航 LogoToken导航

腾讯混元将临界批大小理论引入大模型强化学习

更新时间 2026-09-24来源 AIBase正文 579字阅读约 2分钟

大模型强化学习正奔向更大的GPU集群和更厚的训练数据,训练效率已从一个配角升格为头等大事。腾讯混元团队最新研究把目光投向了一个被忽视已久的老问题:当模型自己生成训练数据、且rollout生成与训练本身以不同节奏缩放时,批大小这门手艺该怎么重做。

研究从经典的临界批大小理论出发,把它重新推演到在线大语言模型强化学习这个新场景。结论很务实:在GRPO和PPO这两类主流算法里,只要在扩大批大小的有界范围内重新调一调学习率,就能保住"每条响应"该学到的东西不被稀释。也就是说,批大小不是越大越好、也不是一成不变,而是存在一个能调教清楚的甜蜜区间。

落到实打实的硬件账单上,收益相当醒目。在固定硬件配置下,把批大小往上扩,PPO生成阶段的吞吐量最高提升2.29倍;而测量到的最佳GRPO配置,用比此前少29%的时间就跑到了同一个验证目标。对天天烧卡的训练团队来说,这意味着同样一张集群、同样一个目标,要么更快地交卷,要么在单位时间里吞吐更多——强化学习里最贵的那部分生成开销,被悄悄挤出了水分。

这项研究的意义在于,它给在线RL的规模化提供了一把可操作的旋钮:模型在强化学习里既是学生也是出题人,生成与训练两条流水线的缩放失配正是效率黑洞的源头,而临界批大小加学习率重调的组合,恰好补上了这道缝隙。当行业还在比谁的模型更大,腾讯混元先把刀磨向了怎么让已有的卡跑得更划算。

资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多