太疯狂了,直播训练大模型。
今天凌晨,小米MiMo 大模型负责人、原 DeepSeek 核心成员罗福莉发文宣布:小米新一代模型 MiMo-V2.6 正处于强化学习(RL)训练阶段,训练过程实时对外直播。
直播页面同时跑着两个模型,MiMo-V2.6-Pro 和 MiMo-V2.6-Flash。
页面上的数据直接来自训练器日志,实时变化。
直播大模型训练这个操作,堪称行业首次。
罗福莉称,团队近半一直研究一个问题:强化学习,到底还能扩展到多远?
本次训练在三个维度做了扩展:
- 算力(每步约 20 亿 token,1568 个提示词 × 16 次推演,完全异步)
- 环境与工具框架(多任务智能体强化学习,单次运行混合多个框架)
- 评分器算力(智能体组内学分分配,基于测试用例与评分细则的奖励)
她表示相关细节将在未来几周逐步开源,直播最震撼、最直观的数字就是钱。
截至现在,仪表盘显示两条训练线累计花费已超过113万美元。
直播界面是一个大仪表盘,内容分了四块:
- 顶部是通知栏,滚动着故障和评测公告;
- 中间是两条训练线各自的花费、步数和 token 数;
- 往下是每一步的数据配比;
- 最底下是评测成绩。
要看懂这些数字,先要知道这轮训练在做什么。
简单说,是让模型自己做题。每道题是一个真实的软件工程任务,模型被放进带代码库、终端和测试用例的环境里,自己改代码、跑测试。做完一道题,评分器给它打分。
等一批任务全部做完,分数汇总起来,模型参数更新一次。
这就叫一个训练「Step」(一步)。每一步,模型会把1568道题各做16遍,产生约2.5万条答题记录。
所以一步的开销有三块:模型答题、评分器打分、更新参数。
有了这个框架,我们再看仪表盘的读数。
两条线里 Pro 更贵。Pro每步约7.4万美元,Flash每步约2万美元。
时间上,Pro一步里模型答题花58分钟,更新参数花64分钟,合计2小时06分。
这个价钱贵不贵,有两个现成的参照。
DeepSeek-R1 的强化学习阶段花了29.4万美元,用512张 H800。MiniMax-M1 的强化学习阶段花了53.5万美元,同样512张H800跑了三周。
现在,小米两条线两天就花掉了113万美元,比这两家加起来还多,而且还在跑。
Jina AI 创始人肖涵直接点评到,「别让 CFO 看到这个」。。
确实。
但它这么贵,倒不完全是因为卡用得多。
这个成本主要贵在题型。
钱烧在什么题上,页面第三块给了答案。仪表盘把每一步喂入的 25 个数据集按类别列了出来,这也是国内厂商首次公开强化学习阶段的数据配比。
代码占三分之二,视觉占 13.1%,对话只有 3%。代码为主,一道题平均 55 轮工具调用、9 万 token 上下文,一步要做 2.5 万道。
光是让模型把题做完,就比对答案贵得多。
除了公布花多少钱,仪表盘还直播训练时发生的故障。
通知栏里赫然写到,例如「Pro 训练因一个节点的显存问题正在重启」。
很实在了。
◈成绩如何
钱花了,题也刷了。
那模型到底有没有变强?
页面最底下一块是评测成绩,展示了训练的成绩,用的是DeepSWE v1.1。
先说结论。
Pro 训练到第10步时得63.72分,追平了DeepSeek-V4-Pro,Flash在第12步得60.77。
DeepSWE v1.1 版有113道真实软件工程长程任务,和MiMo训练用的题是同一类,官方榜单(pass@1)头部成绩如下。
目前,MiMo-V2.6 pro的成绩离榜首差12分,离Claude Fable 5差7分。
按现在的烧法,补上这个差距要多少钱?
仪表盘还公开了一个指标,叫训练通过率。
可以简单理解成:在当前这一步的1568道题、每题 16 次尝试里,模型平均有多少任务能够通过。
旁边还会直接告诉你,相比第一步涨了多少。
这就有意思了。
Pro 到第11步时,训练通过率达到61.4%,相比第 1 步提升4.9个百分点。
也就是说,前面10次更新下来,平均一步大约涨0.5个百分点。
这段训练累计花费大约70万美元。
粗略折算下来:
Pro的训练通过率每提高1个百分点,大约要花14万美元。
Flash 就便宜多了。
到第16步时,Flash 的训练通过率为60.3%,相比第一步提高了8.9个百分点。
平均每一步,大约涨0.6个百分点。
折算下来,Flash 每涨 1 个百分点,大约只要3.8万美元。
差不多是 Pro 的四分之一。
而且,从现在的数据看,增长速度还没有明显慢下来。
强化学习究竟能够扩展到多远?
现在,这条曲线已经有了一个最初的答案。
◈小米大模型近期进展
把时间线往前拉,这已经是小米今年在大模型上的第四波动作。
今年3月,一个名为 Hunter Alpha 的匿名模型突然登顶 OpenRouter 调用榜。
因为能力表现太强,一度被不少开发者猜成 DeepSeek V4。
后来小米出来认领,这是MiMo-V2-Pro。
4月27日,MiMo-V2.5系列正式以MIT协议开源。
其中 Pro 版总参数达到 1T,激活参数42B,上下文长度达到100 万 token。
也是在同一天,小米宣布未来三年将在 AI 领域投入超过600亿元。
到了 6 月,小米又发布 UltraSpeed 版本,把一个 1T 参数模型的输出速度推到 每秒 1000 token,同时公开了后训练方法 MOPD 的论文。
过去看大模型训练,很像看一栋楼的竣工照。
模型厂商告诉你最终Benchmark多高、参数多少、用了什么方法,但中间究竟怎么练,基本看不到。
小米这次干脆把工地监控也开了。
大家第一次能够比较具体地看到:
一个前沿大模型在强化学习阶段,每一步到底在干什么,一步多少钱,以及这些钱究竟能不能继续换来能力。
现在,模型现在还没有练完,一起期待 V2.6 最终的表现吧。







