Token导航 LogoToken导航TokenDH.com

小米直播大模型训练,两天烧掉800万

更新时间 2026-09-17来源 夕小瑶科技说正文 2262字阅读约 8分钟

太疯狂了,直播训练大模型。

今天凌晨,小米MiMo 大模型负责人、原 DeepSeek 核心成员罗福莉发文宣布:小米新一代模型 MiMo-V2.6 正处于强化学习(RL)训练阶段,训练过程实时对外直播

直播页面同时跑着两个模型,MiMo-V2.6-Pro 和 MiMo-V2.6-Flash。

页面上的数据直接来自训练器日志,实时变化。

直播大模型训练这个操作,堪称行业首次。

罗福莉称,团队近半一直研究一个问题:强化学习,到底还能扩展到多远?

本次训练在三个维度做了扩展:

  • 算力
    (每步约 20 亿 token,1568 个提示词 × 16 次推演,完全异步)
  • 环境与工具框架
    (多任务智能体强化学习,单次运行混合多个框架)
  • 评分器算力
    (智能体组内学分分配,基于测试用例与评分细则的奖励)

她表示相关细节将在未来几周逐步开源,直播最震撼、最直观的数字就是钱。

截至现在,仪表盘显示两条训练线累计花费已超过113万美元。

直播界面是一个大仪表盘,内容分了四块:

  1. 顶部是通知栏,滚动着故障和评测公告;
  2. 中间是两条训练线各自的花费、步数和 token 数;
  3. 往下是每一步的数据配比;
  4. 最底下是评测成绩。

要看懂这些数字,先要知道这轮训练在做什么。

简单说,是让模型自己做题。每道题是一个真实的软件工程任务,模型被放进带代码库、终端和测试用例的环境里,自己改代码、跑测试。做完一道题,评分器给它打分。

等一批任务全部做完,分数汇总起来,模型参数更新一次。

这就叫一个训练「Step」(一步)。每一步,模型会把1568道题各做16遍,产生约2.5万条答题记录。

所以一步的开销有三块:模型答题、评分器打分、更新参数。

有了这个框架,我们再看仪表盘的读数。

两条线里 Pro 更贵。Pro每步约7.4万美元,Flash每步约2万美元。

时间上,Pro一步里模型答题花58分钟,更新参数花64分钟,合计2小时06分。

这个价钱贵不贵,有两个现成的参照。

DeepSeek-R1 的强化学习阶段花了29.4万美元,用512张 H800。MiniMax-M1 的强化学习阶段花了53.5万美元,同样512张H800跑了三周。

现在,小米两条线两天就花掉了113万美元,比这两家加起来还多,而且还在跑。

Jina AI 创始人肖涵直接点评到,「别让 CFO 看到这个」。。

确实。

但它这么贵,倒不完全是因为卡用得多。

这个成本主要贵在题型。

钱烧在什么题上,页面第三块给了答案。仪表盘把每一步喂入的 25 个数据集按类别列了出来,这也是国内厂商首次公开强化学习阶段的数据配比。

代码占三分之二,视觉占 13.1%,对话只有 3%。代码为主,一道题平均 55 轮工具调用、9 万 token 上下文,一步要做 2.5 万道。

光是让模型把题做完,就比对答案贵得多。

除了公布花多少钱,仪表盘还直播训练时发生的故障。

通知栏里赫然写到,例如「Pro 训练因一个节点的显存问题正在重启」。

很实在了。

◈成绩如何

钱花了,题也刷了。

那模型到底有没有变强?

页面最底下一块是评测成绩,展示了训练的成绩,用的是DeepSWE v1.1。

先说结论。

Pro 训练到第10步时得63.72分,追平了DeepSeek-V4-Pro,Flash在第12步得60.77。

DeepSWE v1.1 版有113道真实软件工程长程任务,和MiMo训练用的题是同一类,官方榜单(pass@1)头部成绩如下。

目前,MiMo-V2.6 pro的成绩离榜首差12分,离Claude Fable 5差7分。

按现在的烧法,补上这个差距要多少钱?

仪表盘还公开了一个指标,叫训练通过率

可以简单理解成:在当前这一步的1568道题、每题 16 次尝试里,模型平均有多少任务能够通过。

旁边还会直接告诉你,相比第一步涨了多少。

这就有意思了。

Pro 到第11步时,训练通过率达到61.4%,相比第 1 步提升4.9个百分点

也就是说,前面10次更新下来,平均一步大约涨0.5个百分点

这段训练累计花费大约70万美元。

粗略折算下来:

Pro的训练通过率每提高1个百分点,大约要花14万美元。

Flash 就便宜多了。

到第16步时,Flash 的训练通过率为60.3%,相比第一步提高了8.9个百分点

平均每一步,大约涨0.6个百分点

折算下来,Flash 每涨 1 个百分点,大约只要3.8万美元。

差不多是 Pro 的四分之一。

而且,从现在的数据看,增长速度还没有明显慢下来。

强化学习究竟能够扩展到多远?

现在,这条曲线已经有了一个最初的答案。

◈小米大模型近期进展

把时间线往前拉,这已经是小米今年在大模型上的第四波动作。

今年3月,一个名为 Hunter Alpha 的匿名模型突然登顶 OpenRouter 调用榜。

因为能力表现太强,一度被不少开发者猜成 DeepSeek V4。

后来小米出来认领,这是MiMo-V2-Pro

4月27日,MiMo-V2.5系列正式以MIT协议开源。

其中 Pro 版总参数达到 1T,激活参数42B,上下文长度达到100 万 token

也是在同一天,小米宣布未来三年将在 AI 领域投入超过600亿元

到了 6 月,小米又发布 UltraSpeed 版本,把一个 1T 参数模型的输出速度推到 每秒 1000 token,同时公开了后训练方法 MOPD 的论文。

过去看大模型训练,很像看一栋楼的竣工照。

模型厂商告诉你最终Benchmark多高、参数多少、用了什么方法,但中间究竟怎么练,基本看不到。

小米这次干脆把工地监控也开了。

大家第一次能够比较具体地看到:

一个前沿大模型在强化学习阶段,每一步到底在干什么,一步多少钱,以及这些钱究竟能不能继续换来能力。

现在,模型现在还没有练完,一起期待 V2.6 最终的表现吧。

文章标签大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多