Token导航 LogoToken导航TokenDH.com

超越GRPO与SkillRL!小红书提出自进化智能体技能RL新范式,单模型协同无需分模块训练

更新时间 2026-06-06来源 智猩猩正文 3120字阅读约 10分钟9 张图片

智猩猩AI整理

编辑:林夕

现在大模型做成智能体后有个硬伤:模型训练结束参数就固定了,上线碰到陌生新任务,没法边运行边从实操里总结经验、自主变强。

为解决这个问题,业界兴起经验自进化智能体方向:让智能体从过往交互提炼可用经验,辅助后续任务决策。

但现有方案大多只优化经验怎么存、怎么调取,不去训练模型本身会不会提炼经验。少数用强化学习的方案,也只优化经验使用环节,经验全靠人工筛选或外部模型把关。

劣质经验会误导训练,久而久之智能体直接忽略所有经验,自进化失效,这是现有方案的通病。

针对上述痛点,小红书研究者提出单模型协同自进化RL框架Evolving-R,跳出分模块独立训练思路,将经验技能提取、技能落地使用放在同一个模型参数内协同迭代,依靠下游任务表现生成双重监督信号,驱动两部分协同进化。

在ALFWorld室内交互、Mind2Web网页操控两大权威测试集上,Evolving-RL表现碾压全部基线,ALFWorld未知任务相对GRPO基线最高提升98.7%,Mind2Web未知场景相对提升35.8%。

图片
  • 论文标题:

    Evolving-RL: End-to-End Optimization of Experience-Driven Self-Evolving Capability within Agents

  • 论文链接:https://arxiv.org/pdf/2605.10663 

01

方法

Evolving-RL核心只用同一个大模型参数,同时练技能提取、技能使用两件事,不分两个模型分开训练。

整套训练闭环分为源任务交互、文本技能抽取、下游跨任务评测、双向联合优化四大环节,全程不用拆分两个独立模型训练。

图片

一、双角色共用主干模型


模型内置提取器、求解器,二者参数完全共享。

1)提取器:拿智能体过往做任务留下的交互记录,提炼出结构化文本技能(写明操作步骤、出错怎么补救);

2)求解器:拿到新任务+提炼出来的技能,实际跑任务、生成动作。

单次训练迭代从无技能辅助的源任务推演开始:求解器和环境交互生成完整源任务轨迹与环境回报,该轨迹数据作为萃取器的输入素材,启动后续技能生成流程。

二、提取器在线技能生成与泛化评测


提取器依据单条交互轨迹生成N组候选技能,通过原任务描述向量检索K个关联下游任务,全部候选在相同任务中统一测试,依靠多任务平均收益衡量技能品质。

训练引入KL正则与负熵约束,克制无意义的杂乱生成,保障提取过程稳定可控。

三、求解器分组优化逻辑


同一个下游任务,分别搭配N条不同技能运行,得到N条执行轨迹划为一个对比组。

(1)用好技能顺利拿高分→模型被鼓励学会利用优质经验;
(2)用劣质技能拿低分→模型受惩罚,慢慢学会避开错误经验。汇总全部测试轨迹数据更新求解器,搭配KL约束防止模型跑偏。

四、联合优化与协同进化


总损失加权融合萃取、求解两部分损失,双模块共享模型参数同步更新。

形成闭环:下游表现约束萃取器产出通用技能;多样优劣技能混合训练,打磨求解器灵活使用、抵御劣质经验干扰的能力。

五、训练稳定性优化


团队落地两项优化,带异常乱码的技能直接清零奖励、萃取器添加负熵约束,低成本实现单模型稳定协同训练。


联合优化:两者损失加权更新,下游表现倒逼优质技能生成,优劣样本锻炼求解器抗干扰能力,双向闭环进化。
稳定性优化:震荡非参数冲突,由噪声与生成混乱导致;无效技能扣奖励+负熵约束,单模型平稳训练。


图片

02

实验结果与分析

一、实验设置


本次实验统一以Qwen2.5-7B-Instruct为基座模型,在ALFWorld文本居家交互、Mind2Web网页导航两大数据集开展测评,对比方案覆盖提示类自进化基线ExpeL、Memento、ReasoningBank与强化学习基线GRPO、SkillRL,所有实验重复5轮取平均结果保证可靠性。

二、ALFWorld数据集主实验结果


ALFWorld按照任务类型拆分已见、未知任务,w/skills代表推理阶段注入自研提取技能,w/o skills代表无额外技能注入。

图片


  • 基线表现:原始基座模型全任务平均成功率仅45.5%,注入自身提取劣质技能后反而小幅下滑至 44.5%;传统提示式方法ReasoningBank、ExpeL、Memento 整体上限卡在41.1%~53.0%区间;经典强化学习GRPO无技能45.5%,搭配自有技能后未知任务成功率44.6%、整体83.3%;
  • Evolving-RL效果:无技能注入整体成功率93.1%,带技能达到96.0%;重点关注泛化能力的未知任务,无技能81.1%、带技能88.6%,相对GRPO带技能基线提升近一倍,印证模型已将经验内化进参数,推理加技能进一步释放萃取收益。

二、Mind2Web数据集主实验结果


数据集分为跨任务、跨网站、跨域三大高难度泛化场景,指标包含动作准确率与任务成功率。

图片
  • GRPO基线整体动作准确率22.83%,自带技能后22.73%几乎无提升;
  • Evolving-RL无技能整体准确率28.05%,带技能飙升至30.87%;细分场景中跨任务准确率从GRPO的28.79%升至41.99%,跨网站由24.61%升至35.14%,跨域由20.84%升至26.97%,仅跨网站场景技能增益有限,原因是该场景样本分布和训练集差距过大,难以提炼有效经验。

三、消融实验


(1)优化目标消融

实验划分单独训练提取器、单独训练求解器、二者协同进化三组对照。


    图片

    仅训练提取器: Seen任务小幅上涨,但未知任务提升微乎其微,技能严重过拟合训练数据,无法泛化;
    仅训练求解器:无技能整体90.9%大幅优于基线,但测试注入技能无正向收益,模型在海量劣质技能训练中养成无视技能的决策习惯;
    完整协同进化:兼顾Seen与Unseen任务表现,无技能93.1%、带技能96.0%,证明提取+求解联合优化是全场景性能拉满的必要条件,缺一不可。
    (2)技能相关性消融

    设置三类推理条件:无技能、注入相关技能、注入无关技能。

    图片

    无关技能取自语义差距最远的任务萃取内容,结果显示无关技能性能和无技能持平,相关技能显著涨分。

    实验排除 “模型只是适配prompt格式带来涨分” 的猜想,证明模型能够读懂技能语义,且遇到无效参考信息时可自主屏蔽负面影响,鲁棒性突出。

    (3)技能跨模型迁移实验

    将Evolving-RL萃取的技能分别喂给原始基座模型、GRPO训练模型。


      图片

      • 原生基座模型无技能45.5%,自研技能注入后提升至60.4%;
      • GRPO模型无技能79.9%,自研技能加持后来到88.8%,同时完成任务平均操作步骤明显缩短。
      该结果证明Evolving-RL提炼的技能具备通用属性,并非适配自身模型的私有话术,萃取能力得到实质性提升。

      (4)实例案例


      针对 “把花瓶放入保险箱” 同一任务,基座模型提取技能步骤错乱、缺失拾取关键操作;Evolving-RL产出的技能步骤逻辑严谨、操作完整,精准概括物体定位、拾取、收纳全流程,从内容层面直观解释性能差距由来。

      图片

      03

      总结

      Evolving-RL跳出了现阶段经验型自进化智能体的固有研发思路。

      此前行业做智能体自进化,普遍把重心放在记忆库架构、经验存储检索优化上,默认模型原生提取经验能力固定,靠人工或外部大模型兜底筛选优质样本,劣质经验致智能体废用经验是无解顽疾。

      而小红书团队直接切入底层参数训练,用一套强化学习闭环同步打磨提炼、使用”两项核心能力,从根源根除痛点。

      该框架的创新具备双重实用价值:

      一方面满足智能体上线持续从实操自学进化的需求,推理阶段积累经验即可实时提效;

      另一方面作为通用增强型强化学习算法,不依赖在线经验补充也能优化基座模型泛化能力,既能用于各类网页、具身交互智能体落地,也可迁移到工具调用、复杂任务规划等大模型应用场景。

      文章标签智能体学术研究
      资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

      继续浏览更多资讯

      返回资讯目录

      相关资讯

      更多