Token导航 LogoToken导航

后训练平台2周完成模型升级适配应用公司

更新时间 2026-09-28来源 ZPotentials正文 3058字阅读约 10分钟1 张图片
图片

01 模型上线,并不意味着训练结束

过去,一家公司训练模型,往往像交付一个项目:准备数据、启动训练、拿到模型,然后上线。

现在,这个过程越来越像软件更新。

Cursor正在用真实用户反馈训练其编程模型Composer。新模型上线后,团队观察用户是否接受模型生成的代码,再把这些结果转化为下一轮训练信号。最快时,Cursor每五小时就能推送一个新的checkpoint。

这意味着模型研发方式发生了变化:模型不再关起门来训练完成,再一次性交给用户;它可以先进入真实场景,从使用结果中发现问题,然后继续更新。

企业之间的竞争也因此多了一层。大家比较的不只是“谁的模型现在更强”,还包括谁能更快发现问题、完成训练,并把改进后的版本重新送回生产环境。

Mind Lab此次发布的Mint Recursive,就是围绕这套循环搭建的模型后训练与推理平台。与平台同时发布的后训练模型Macaron V1.1,则是一次实际演示:Mind Lab借助这套系统,用两周完成了完成了基于GLM5.3的后训练。

Macaron V1.1的发布,也让外界得以看到Mint Recursive实际参与模型迭代的方式。

02 企业真正想拥有的,是自己的判断

为什么越来越多企业希望拥有自己的模型?

随着基础模型能力提高,不同企业都能获得一个不错的起点。但基础能力越接近,企业之间的差异就越取决于另一件事:模型是否理解自己的业务标准。

一家投资机构判断什么信息值得关注,一家法律公司决定什么内容必须引用,一家电商平台处理售后问题时愿意承担多大风险。这些标准很难由通用模型天然掌握。

Bridgewater旗下AIA Labs与Thinking Machines做过一项实验,让模型判断财经报道是否值得投资人阅读。仅仅优化提示词,提升很快遇到上限;加入投资专家筛选和标注的数据后,模型的判断才出现明显改善。

模型学到的,是投资人筛选信息的尺度。

企业真正有价值的知识,很多都以这种形式存在。它们没有完整写在制度和文档里,而是藏在专家做过的大量选择中,也藏在用户对产品的一次次接受、拒绝和修改中。

因此,拥有自己的模型不一定是从头训练一个基础模型。对大多数企业来说,更现实的目标是拥有一个可控制、可更新的模型版本,并掌握围绕它形成的数据、评测标准和训练方法。

基础模型可以更换,但从真实业务中积累下来的判断,需要用某种方式保留下来。

03 持续训练真正的瓶颈是基础设施

道理并不复杂,实施起来却很困难。

完成一次模型后训练,需要训练、推理和任务环境互相配合,其中任何一环等待或出错,整轮训练都会被拖慢。

更麻烦的是,一些看似纯粹的工程问题,也会改变训练结果。

可以把它理解为:模型生成答案时用了一把尺子,训练时又换了另一把尺子。两边的计算方式稍有差异,训练系统就可能把误差当成模型进步或退步。模型越大、结构越复杂,这类问题越难发现。

所以,基础设施不是后训练之外的辅助工作。它决定了反馈能否准确进入模型,也决定了下一轮训练需要几天、几周,还是根本无法完成。

Mint Recursive正是从Mind Lab自己的训练需求中生长出来的。团队最初为了在超大参数模型上训练Macaron,需要处理显存、通信、训推一致性和权重切换等问题。围绕这些问题积累的部分技术,也被用于英伟达的Megtron-Bridge和字节的Verl等开源训练项目。

在内部系统逐渐稳定后,Mind Lab才把评测、数据、训练和部署整理成一套对外平台。换句话说,Mint Recursive不是先有一个平台概念,再寻找使用场景;它首先在内部完成了验证,然后才成为一项企业服务。

04 让模型迭代有据可循

训练模型之前,企业首先要回答一个问题:模型究竟差在哪里?

Mint Recursive的做法,是先定义业务Benchmark,自动运行评测并按标准判断结果。失败案例可以整理成训练数据,同一套Benchmark也会用于模型训练后的验收。

这样一来,评测不只是训练结束后的验收环节,也决定了下一轮训练往哪里走。对许多企业而言,困难往往不是没有数据,而是不知道哪些数据值得训练。如果模型的问题没有被准确定位,增加数据只会让训练规模变大,未必带来更好的结果。

完成训练后,新模型会再次接受同一套Benchmark的检验。团队可以比较新旧版本的表现,查看哪些能力有所改善、哪些地方出现退步,再决定是否上线。数据、训练配置和模型版本也会被关联起来,方便后续追踪和回退。

Macaron V1.1是这套流程的一次实际应用。它将基座从GLM-5.2升级到GLM-5.3,同时保留面向Chat、Agent、Coding和Generative UI的四个LoRA专家。由于上一版本积累的评测、数据和训练流程可以继续使用,这次升级用时两周。

这个案例说明,基础模型换代并不一定意味着从头开始。只要评测标准、业务数据和训练方法能够沉淀下来,企业就可以更换基座,同时延续已经形成的专业能力。

Mint Recursive所管理的,也不只是某一次训练,而是模型从发现问题、完成更新到验证结果的全过程。对企业来说,这套能够反复使用的迭代流程,可能比某一个模型版本本身更值得积累。

05 后训练平台正在成为新的中间层

大模型产业正在出现一块新的中间地带。

一端是快速更新的开源模型,另一端是掌握用户、场景和行业数据的应用公司。前者提供通用能力,后者知道模型在具体工作中应该做到什么,但两者之间还缺少一条足够低成本的连接方式。

过去,企业要么直接调用通用模型,要么组建团队、自建集群,完成一套定制训练。前一种方式启动快,却很难沉淀专有能力;后一种方式控制力更强,但工程成本和试错门槛都很高。后训练平台试图填补的,正是两者之间的空白。

Fireworks、Baseten以及Mint Recursive近期推出的产品,虽然实现方式不同,但方向相近:让企业不必承担完整的底层工程,也能参与模型训练。随着这类服务出现,拥有专属模型不再只是大型实验室的选择,中小团队也可以从一个具体任务开始尝试。

这也改变了产业链上的分工。基础模型公司负责提高通用能力上限,应用公司提供业务场景和判断标准,后训练平台则负责把这些经验转化为可以运行的模型版本。它既不是单纯出售算力,也不直接替企业定义产品,而是提供连接模型与业务的训练基础设施。

过去,企业主要选择“使用哪个模型”。随着基础模型越来越丰富,下一个问题会变成:企业能否把自己的经验留在模型里,而不是在每次更换基座时重新开始。后训练平台的机会,就来自这两种能力之间的距离。

参考文章

  • Cursor, “Improving Composer through real-time RL”

  • Thinking Machines Lab / Bridgewater AIA Labs, “Learning to Replicate Expert Judgment in Financial Tasks”

  • Harvey, “Post-training update: Harvey Tenet”

  • Modal, “Reinforcement Learning Is an Infrastructure Problem”

  • Mind Lab, “Building Trillion-Parameter Reasoning RL with 10% GPUs”

  • NVIDIA Megatron-Bridge Documentation;verl Release Notes

  • Fireworks, “Train Past the Frontier”

  • Baseten, “Introducing the Baseten Loops SDK”

文章标签模型发布产品更新AI产品
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多