Token导航 LogoToken导航TokenDH.com

清华同一天发表两篇Skill力作,捅破了Agent技能自进化的天花板!

更新时间 2026-05-25来源 智猩猩正文 3728字阅读约 12分钟13 张图片

智猩猩AI整理

编辑:林夕

2026 年 5 月 11 日,arXiv 同一天上线两篇技能自进化方向重磅论文 —— 来自清华、北交大的SkillEvolver,与南大、微软、清华AIR联合推出的EmbodiSkill。

几乎同步给出了同一核心答案:AI智能体的能力提升,可通过技能自进化实现,无需重新训练大模型。


两篇论文同源、同赛道、同天发布,却一个扎根数字工具场景,一个深耕具身智能环境,把技能自进化的天花板直接捅破。

SkillEvolver提出元技能驱动的在线学习框架,通过策略多样化探索、对比式更新和独立审计三阶段,让一个CLI-Agent为下游Agent生成可复用技能。

EmbodiSkill提出技能感知反思机制,将轨迹对技能的影响分为发现、优化、技能缺陷、执行失误四类,实现选择性更新。

实验表明,SkillEvolver在SkillsBench上达到56.8%平均成功率,超过人类编写技能的43.6%;EmbodiSkill在ALFWorld上达到93.28%,反超GPT-5.2直接执行的70.89%。

图片

  • 论文标题: SKILLEVOLVER: SKILL LEARNING AS A META-SKILL
  • 论文链接: https://arxiv.org/abs/2605.10500

图片
  • 论文标题: EmbodiSkill: Skill-Aware Reflection for Self-Evolving Embodied Agents
  • 论文链接: https://arxiv.org/abs/2605.10

01

一个共同的困境

当前AI智能体普遍依赖“技能”来执行任务。所谓技能,就是一份指导说明书——告诉智能体先做什么、后做什么、遇到什么情况怎么办。

问题是,这份说明书是静态的。一旦写好就不再更新。环境变了、任务换了,说明书就过时了。

更麻烦的是,当智能体按照技能执行失败时,现有方法无法区分两种不同的失败原因:

  • 技能缺陷:说明书本身写错了。

  • 执行失误:说明书正确,但智能体没照着做。

现有方法把整条执行记录当作反馈,然后直接重写整个技能。结果就是:明明是执行失误,却被当成技能缺陷,正确的内容被删掉或覆盖,技能越改越乱。

两篇论文的第一张图都很好地展示了各自的核心理念:

  • SkillEvolver:展示元技能(Meta-Skill)如何作为可插拔组件,指导CLI-Agent生成领域技能。

图片
  • EmbodiSkill:通过对比“无技能”“静态技能”“技能无感知进化”和“EmbodiSkill”四种情况,展示技能感知反思的重要性。

    图片

02

SkillEvolver角色分离

实现元技能自进化

大多数时候,写手册的AI和用手册的AI是同一个人。自己写的东西自己用,你很难发现哪里写得不好——因为你想的和你写的,在你脑子里是一回事。

SkillEvolver的解决方案是角色分离:让一个AI专门负责编写技能(作者),交给另一个AI去执行(执行者)。作者不知道执行者会如何理解指令,执行者只能照章行事。这种信息不对称使技能的缺陷在执行中自然暴露。

一、核心原理

(1) 核心载体


SkillEvolver 本身被定义为一项通用元技能,是一套标准化指导AI创作、修订、审核各类领域技能的程序性体系。该框架轻量化、可插拔、无需模型微调,能够适配各类CLI智能体,实现跨场景的技能自主进化。整个流程包含三个阶段。

(2)三段式闭环迭代流程


第一阶段:策略多样化探索。

每轮迭代中,作者为执行者生成4条策略。这些策略在关键决策轴上必须有实质性差异。每条策略由一个独立的执行者运行,记录成功或失败。

第二阶段:对比式更新。

将成功轨迹与失败轨迹进行对比,提取差异,这些差异就是技能需要补充或修改的地方。基于差异生成补丁式修订,只修改被证据指向的内容,而非整体重写。

第三阶段:独立审计。

启动一个全新的AI会话作为审计官,对候选技能进行检查。审计官不依赖作者的上下文,仅基于技能本身进行判断。审计规则共9条,覆盖三类问题:

  • 过拟合检测:是否包含训练数据的具体文件名或数值

  • 可执行性检测:是否声明了主脚本但执行者从未调用(即“静默绕过”)

  • 抽象程度检测:指令是否过于模糊或包含不可追溯的断言

图片

二、实验设置


本次实验基于覆盖15+专业领域、包含83项细分任务的SkillsBench通用多领域数据集与KernelBench GPU内核优化任务两大数字场景权威基准,以无技能裸模型、人类专家精选技能为对照基线,通过统计任务成功率、GPU加速比、迭代成本、token消耗及交互时长等多维指标,全面验证SkillEvolver的技能自进化性能与落地效率。

三、核心实验

两轮迭代后的SkillEvolver在SkillsBench数据集上准确率达到56.8%,明显高于 29.9%的无技能基线,同时胜过43.6%的人工编写技能水准。

KernelBench测试中,GPU内核平均加速比从1.16增长至1.51,该优化能力可适配各类连续优化相关任务。


图片


整体使用成本控制良好,单任务耗费3.92美元,相较单轮迭代仅上浮8%;还能使下游智能体token消耗降低19.4%,交互耗时缩减23.8%。


图片


从细分任务拆解来看,SkillEvolver的优化增益极具针对性:性能提升主要集中在人工技能失效、无法解锁任务、甚至产生反向效果的高难度场景;在基础简单任务中,效果与基线持平,实现算力与资源的精准倾斜,重点攻克复杂任务短板。



图片

03

EmbodiSkill让机器人分清

“错了”和“没做好”


在数字场景中,SkillEvolver可以通过“写作AI+执行AI”角色分离,暴露技能缺陷、实现精准迭代。但在机器人、具身交互等真实物理场景中,这套逻辑不再成立。

具身智能体执行家务、导航、物体交互任务时,不存在独立的AI为其编写技能手册,只能实现自执行、自复盘、自修改的单主体闭环。

这就带来一个致命难题:任务失败时,智能体无法区分问题根源

传统方法会将所有执行失败统一判定为“技能错误”,直接覆盖重写整本技能手册。旧算法会错误修改正确规则,导致有效技能被不断改坏、越迭代越退化。

一、 核心创新


针对具身场景的特有痛点,EmbodiSkill提出技能感知式反思与靶向修订框架,核心思路是:拆分技能结构、细分失败类型、区分该不该改

(1)双层技能结构:技能体 + 附录


EmbodiSkill不改动模型参数,全程实现无训练、外部化迭代。它将单一技能拆分为两大模块,彻底解决误修改问题:

  • 技能体(核心正文规则):存储标准、正确的任务执行逻辑,是智能体的核心操作手册。

  • 附录(动态提醒事项):专门记录执行偏差、操作疏漏等个性化问题,不改动主干规则。

(2)四类精细化反思,解决误迭代问题


模型将所有任务轨迹分为四类反馈信号,核心创新在于区分技能缺陷与执行失误

针对发现、优化、技能缺陷三类问题,会针对性修订技能体、补齐规则漏洞;针对执行失误,严格保留原有正确技能体,仅在附录追加操作提醒、合并去重,彻底避免正确规则被错误覆盖。

(3)三段式闭环修订流程


当执行轨迹积累足够有效反馈后,系统启动标准化迭代流程,实现精准优化:

第一步,聚合多轮反思信号,对发现、优化、缺陷类信息去重、消冲突,筛选有效迭代依据;

第二步,仅针对信号指向的问题点位,局部修订技能体内容,不全局重写;

第三步,利用执行失误信号更新附录提醒,形成差异化记录。

图片

最终构建完整进化闭环:技能 → 执行交互 → 轨迹反思 → 信号累积 → 靶向修订 → 全新技能

二、 实验设置


为全面验证具身技能自进化能力,实验基于两大主流具身智能评测基准:ALFWorld 家庭操控任务EmbodiedBench 物体交互与导航任务

实验统一固定Qwen2.5-14B、Qwen3.5-27B、Qwen3-VL系列模型为执行器,全程冻结参数,仅通过技能迭代提升性能;同时采用GPT-5.2、Gemini-3-flash 作为技能进化模型。

三、核心实验结果


在ALFWorld任务上,冻结参数的Qwen3.5-27B 搭配EmbodiSkill,任务成功率达93.28%,论文官方口径较GPT-5.2直接执行领先31.58个百分点;六类子任务中五类取得最优 / 并列最优,Puttwo多物体子任务达到100%满分。

图片

下图显示,EmbodiSkill在10轮修订中快速上升并稳定在高位,而不加区分、整体重写的无感知进化波动更大且收敛于较低区间。


图片

在EmbodiedBench上,EmbodiSkill在EB-Habitat达到52.33%,在EB-Navigation达到61.33%。

图片


消融实验表明静态技能优于无技能,技能自进化优于静态技能,技能感知式靶向进化效果远高于粗粒度全局更新,每一轮轨迹都能贡献精准优化信号,技能逐步完善。

图片

04

总结

两篇独立论文从不同方向回答了同一个问题。

SkillEvolver证明了分离技能的作者与执行者,通过策略多样化探索、对比式更新和独立审计,可以使AI生成的技能超过人类专家水平。EmbodiSkill证明了将执行轨迹细分为四类反思类型,将执行失误隔离到附录而不修改技能体,可以避免正确内容被错误覆盖,使冻结参数的模型反超更大规模的闭源模型。

两条路,一个方向:AI智能体的能力提升可以通过外部技能的自进化实现,无需更新模型参数。

文章标签智能体机器人
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多