智猩猩AI整理
现在大模型做成智能体后有个硬伤:模型训练结束参数就固定了,上线碰到陌生新任务,没法边运行边从实操里总结经验、自主变强。
为解决这个问题,业界兴起经验自进化智能体方向:让智能体从过往交互提炼可用经验,辅助后续任务决策。
但现有方案大多只优化经验怎么存、怎么调取,不去训练模型本身会不会提炼经验。少数用强化学习的方案,也只优化经验使用环节,经验全靠人工筛选或外部模型把关。
劣质经验会误导训练,久而久之智能体直接忽略所有经验,自进化失效,这是现有方案的通病。
针对上述痛点,小红书研究者提出单模型协同自进化RL框架Evolving-R,跳出分模块独立训练思路,将经验技能提取、技能落地使用放在同一个模型参数内协同迭代,依靠下游任务表现生成双重监督信号,驱动两部分协同进化。
在ALFWorld室内交互、Mind2Web网页操控两大权威测试集上,Evolving-RL表现碾压全部基线,ALFWorld未知任务相对GRPO基线最高提升98.7%,Mind2Web未知场景相对提升35.8%。

论文标题:
Evolving-RL: End-to-End Optimization of Experience-Driven Self-Evolving Capability within Agents
论文链接:https://arxiv.org/pdf/2605.10663
01
方法
Evolving-RL核心只用同一个大模型参数,同时练技能提取、技能使用两件事,不分两个模型分开训练。
整套训练闭环分为源任务交互、文本技能抽取、下游跨任务评测、双向联合优化四大环节,全程不用拆分两个独立模型训练。

一、双角色共用主干模型
模型内置提取器、求解器,二者参数完全共享。
1)提取器:拿智能体过往做任务留下的交互记录,提炼出结构化文本技能(写明操作步骤、出错怎么补救);
2)求解器:拿到新任务+提炼出来的技能,实际跑任务、生成动作。
单次训练迭代从无技能辅助的源任务推演开始:求解器和环境交互生成完整源任务轨迹与环境回报,该轨迹数据作为萃取器的输入素材,启动后续技能生成流程。
二、提取器在线技能生成与泛化评测
提取器依据单条交互轨迹生成N组候选技能,通过原任务描述向量检索K个关联下游任务,全部候选在相同任务中统一测试,依靠多任务平均收益衡量技能品质。
训练引入KL正则与负熵约束,克制无意义的杂乱生成,保障提取过程稳定可控。
三、求解器分组优化逻辑
同一个下游任务,分别搭配N条不同技能运行,得到N条执行轨迹划为一个对比组。
四、联合优化与协同进化
总损失加权融合萃取、求解两部分损失,双模块共享模型参数同步更新。
形成闭环:下游表现约束萃取器产出通用技能;多样优劣技能混合训练,打磨求解器灵活使用、抵御劣质经验干扰的能力。
五、训练稳定性优化
团队落地两项优化,带异常乱码的技能直接清零奖励、萃取器添加负熵约束,低成本实现单模型稳定协同训练。

02
实验结果与分析
一、实验设置
本次实验统一以Qwen2.5-7B-Instruct为基座模型,在ALFWorld文本居家交互、Mind2Web网页导航两大数据集开展测评,对比方案覆盖提示类自进化基线ExpeL、Memento、ReasoningBank与强化学习基线GRPO、SkillRL,所有实验重复5轮取平均结果保证可靠性。
二、ALFWorld数据集主实验结果
ALFWorld按照任务类型拆分已见、未知任务,w/skills代表推理阶段注入自研提取技能,w/o skills代表无额外技能注入。

- 基线表现:原始基座模型全任务平均成功率仅45.5%,注入自身提取劣质技能后反而小幅下滑至 44.5%;传统提示式方法ReasoningBank、ExpeL、Memento 整体上限卡在41.1%~53.0%区间;经典强化学习GRPO无技能45.5%,搭配自有技能后未知任务成功率44.6%、整体83.3%;
- Evolving-RL效果:无技能注入整体成功率93.1%,带技能达到96.0%;重点关注泛化能力的未知任务,无技能81.1%、带技能88.6%,相对GRPO带技能基线提升近一倍,印证模型已将经验内化进参数,推理加技能进一步释放萃取收益。
二、Mind2Web数据集主实验结果
数据集分为跨任务、跨网站、跨域三大高难度泛化场景,指标包含动作准确率与任务成功率。

- GRPO基线整体动作准确率22.83%,自带技能后22.73%几乎无提升;
- Evolving-RL无技能整体准确率28.05%,带技能飙升至30.87%;细分场景中跨任务准确率从GRPO的28.79%升至41.99%,跨网站由24.61%升至35.14%,跨域由20.84%升至26.97%,仅跨网站场景技能增益有限,原因是该场景样本分布和训练集差距过大,难以提炼有效经验。
三、消融实验
(1)优化目标消融
实验划分单独训练提取器、单独训练求解器、二者协同进化三组对照。

(2)技能相关性消融
设置三类推理条件:无技能、注入相关技能、注入无关技能。

无关技能取自语义差距最远的任务萃取内容,结果显示无关技能性能和无技能持平,相关技能显著涨分。
实验排除 “模型只是适配prompt格式带来涨分” 的猜想,证明模型能够读懂技能语义,且遇到无效参考信息时可自主屏蔽负面影响,鲁棒性突出。
(3)技能跨模型迁移实验
将Evolving-RL萃取的技能分别喂给原始基座模型、GRPO训练模型。

- 原生基座模型无技能45.5%,自研技能注入后提升至60.4%;
- GRPO模型无技能79.9%,自研技能加持后来到88.8%,同时完成任务平均操作步骤明显缩短。
(4)实例案例
针对 “把花瓶放入保险箱” 同一任务,基座模型提取技能步骤错乱、缺失拾取关键操作;Evolving-RL产出的技能步骤逻辑严谨、操作完整,精准概括物体定位、拾取、收纳全流程,从内容层面直观解释性能差距由来。

03
总结
Evolving-RL跳出了现阶段经验型自进化智能体的固有研发思路。
此前行业做智能体自进化,普遍把重心放在记忆库架构、经验存储检索优化上,默认模型原生提取经验能力固定,靠人工或外部大模型兜底筛选优质样本,劣质经验致智能体废用经验是无解顽疾。
而小红书团队直接切入底层参数训练,用一套强化学习闭环同步打磨提炼、使用”两项核心能力,从根源根除痛点。
该框架的创新具备双重实用价值:
一方面满足智能体上线持续从实操自学进化的需求,推理阶段积累经验即可实时提效;
另一方面作为通用增强型强化学习算法,不依赖在线经验补充也能优化基座模型泛化能力,既能用于各类网页、具身交互智能体落地,也可迁移到工具调用、复杂任务规划等大模型应用场景。







