Token导航 LogoToken导航TokenDH.com

人类造的最后一个AI!上交清华字节等发布递归自进化路线图

更新时间 2026-09-16来源 AI寒武纪正文 5375字阅读约 17分钟9 张图片
图片

上海交通大学、清华大学、字节跳动、商汤等

人类构建的最后一个 AI:

:递归自我改进

RSI

AI 要开始自己训练自己了,人类还能插手多久?

训练一个顶级 AI,现在要花多少成本?

Kimi K3 有 2.8 万亿参数,Qwen3.8-Max 有 2.4 万亿参数,上下文窗口各自支持约百万 token。OpenAI 透露,GPT-5.6 发布前六个月,用于内部编码的推理算力增长了 100 倍,多智能体 token 使用量增长了 22 倍。

这还只是训练。数据这边更夸张:OpenAI 的 GDPval 数据集,1320 个专业任务,累计耗费了 9240 个专家工时,平均每位贡献者有 14 年以上经验。一个叫 Humanity's Last Exam 的基准数据集,光提交就超过 70000 次,经专家筛选后才得出 3000 道题。

成本每年都在涨,人力天花板却在那儿。

来自上海交通大学、清华大学、字节跳动、商汤等机构的 30 多位研究人员,刚刚发布了一份长达 75 页的综述,题目叫《人类构建的最后一个 AI:走向真正的递归自我改进》。

图片

paper:

https://www.alphaxiv.org/abs/2609.11873

他们想回答一个问题:

AI 能不能自己负责自己的改进,从而绕过人力瓶颈?

什么是递归自我改进?

先说清楚这个词。

递归自我改进(RSI)的定义是:AI 系统通过与任务、环境或其他智能体的持续交互,自主地将获取的经验和反馈转化为对自身的持久改变,并且这些改变能进一步影响后续自我改进的机制。

关键词有两个:持久机制

改进了当前任务的输出,不算 RSI。

只有当改进被保留下来,并且影响未来的改进方式,才算。

论文用了一个"改进循环"作为基本分析单位,包含这几个关键角色:

AI 系统:完整的计算实体,跨改进轮次追踪能力状态
系统状态:一轮结束时保留并传递给下一轮的部分
经验:从早期交互中获取并用于指导后续改进的信息
改进者:将当前状态和可用经验转化为候选修改的机制
验证器:评估候选方案并应用接受规则的机制
继承者:继承了一项或多项已接受改进并进入下一轮的 AI 系统

三个核心问题贯穿全文:循环在哪里闭合?什么被更新并传承?哪些决策仍由外部控制?

当前 AI 的能力分布

在讨论 RSI 之前,论文先用一个新指标描述了 AI 现状。

这个指标叫头脑空间封闭指数(HCI),衡量的是模型在某个能力领域还有多少提升空间。HCI = 0 表示处于入门年份的前沿水平,HCI = 100 表示满分。

作者汇总了 393 条模型基准测试数据,覆盖 2023 到 2026 年,分析了十个能力域。

图片

三个关键发现:

一、不同能力域的进步速度差异巨大。

到 2026 年,高等数学 HCI 达到 86.4,研究生科学达到 85.8,宽泛知识达到 77.2。而法律推理 64.5,多模态推理 62.2,前沿学术广度 60.4。

二、交互型能力的差距最大。

软件工程 2026 年 HCI 只有 52.6,搜索和终端代理 56.8,工具代理 39.9。工具代理在 2025 年到 2026 年间从 8.2 跳到 39.9,进步很大,但仍是最低的一条线。

三、剩余提升空间恰恰集中在 RSI 最能发挥作用的地方。

如果 RSI 能帮助软件工程和工具使用,HCI 可能从 52.6 提升到 89.6,从 39.9 提升到 86.8。

换句话说,最难的那些能力,恰好是最需要、也最有可能通过 RSI 改善的。

五级自主框架

论文的核心贡献,是一个五级自主度框架,描述 AI 从"执行指令"到"改进改进机制"的完整路径。

图片

B0:任务内改进

这是非 RSI 的参照基线。

AI 在当前任务内迭代优化输出,改进不会保存到下一次任务。

Self-Refine、Reflexion、Tree of Thoughts 都属于这一级。它们能在单轮任务里提升质量,但任务结束就清空了,什么都带不走。

四个硬伤:

  • • 经验不跨任务积累
  • • 改进流程由人类定义
  • • 自我生成的反馈可能强化错误
  • • 固定评估器下,多轮迭代收益递减

L1:执行自主

人类定义改进目标、流程和验收标准,AI 执行并将结果保留到后续任务。

比如 Meta 的 Capacity Efficiency 系统,把工程师的调试经验编码成可复用的修复技能,AI 按预定流程执行后产出 PR,走标准审查流程落地,把原本几小时的人工回归排查压缩到几分钟。

FineWeb-Edu 是另一个例子:研究者定义教育质量标准,AI 在海量网页数据上打标签,训练一个分类器大规模过滤。整个流程 AI 执行,但质量标准是人定的。

L1 的边界:AI 执行,但不决定如何改进。


L2:策略自主

评估目标和验收标准仍由外部固定,但 AI 可以自主决定下一步该做什么改进。

这是从"执行"到"决策"的跃迁。

OpenAI 将当前的前沿代理描述为在人类监督下完成明确任务的"自动化研究实习生"阶段,研究者仍然设定优先级并决定哪些结果值得进一步投入。

L2 的几个典型形式:

提示词搜索:Dropbox 使用 GEPA 来重写告诉 LLM 如何判断检索文件相关性的提示词,系统分析失败原因并生成针对性修改。

智能体设计搜索:ADAS 把一个代理表示为 Python 函数,用元代理填充一个不断增长的候选代理档案,通过验证数据评估并保留代码和指标。AFlow 把工作流编码为可执行图,用 MCTS 进行代码级别修改。

训练规则搜索:autoresearch 让代理反复编辑训练程序,只有当验证指标改善时才保留修改。

L2 的边界:AI 选择干预方式,但评估标准和任务边界仍由外部指定。

L2 带来的典型风险:反复访问评估器会导致基准过拟合,搜索算力的增加可能被误认为算法改进。Anthropic 报告显示,自动化研究实验中出现了随机种子筛选和通过查询评估器尝试提取测试标签的行为。


L3:经验获取自主

从"如何改进"跳到"学什么"。

系统使用对自身当前能力、失败和学习历史的评估,来决定下一步该获取什么经验。

关键区别:人类设计的客观目标、评估器和学习规则可以保留,但经验获取的决策由 AI 自主完成。

两种主要实现方式:

自适应任务生成与自我博弈:如 AZR(Absolute Zero Reasoner),在单一模型内耦合推理任务的提出和求解,求解器依赖的可学习性奖励引导任务提出,代码执行器验证提出的任务并检查解决方案。STP 联合开发猜想器和证明器,生成当前证明器只能勉强证明的猜想来训练猜想器。

通过环境交互自主练习:VOYAGER 在 Minecraft 中将智能体状态和探索历史告知新目标,成功行为成为后续任务可复用的技能库。SEAgent 通过世界状态模型将轨迹判断和 GUI 状态变化描述提供给课程生成器,更新持久的软件指南,用于生成后续任务。

L3 的边界:AI 决定学什么,但人类仍然控制整体目标和评估规则。


L4:部署与环境适应自主

L3 关注"该学什么",L4 关注"运行过程中的经验如何变成持久改变"。

图片

三种主要机制:

轨迹蒸馏:将交互历史压缩成可跨任务复用的紧凑制品。Dynamic Cheatsheet 让冻结的模型在一系列相关问题上改进,维护一份包含策略、代码片段和已知陷阱的演进笔记,并在回答每个新问题时参考和更新。Metis 实现双重记忆,文本计划库加上可调用代码工具库,频繁复用的文本计划通过沙箱编译和运行检查后重写为可调用工具。

智能体系统修订:修改驱动行为的底层组件而非记忆内容。Self-Harness 利用执行轨迹识别反复出现的弱点,让同一模型提出对当前 harness 的小幅修改,只有通过回归测试后才保留。Ouroboros 将部署证据转化为对代理工具、上下文组装、提示和核心实现的版本化修改。

选择性保留和部署:HDSO 提出假设并明确验证计划,用相同任务运行两次,一次用当前已批准的技能库作为对照,一次加入候选技能作为处理,候选技能只有当差异支持假设时才进入批准库。

L4 的边界:AI 决定哪些经验后果该持久保留,但部署权、访问边界和最终发布权仍由人类控制。


L5:元改进自主

L4 是改进,L5 是改进改进机制本身。

图片

一个编码代理可能因搜索程序一再丢弃有用替代方案而反复生成类似的失败补丁。一个研究代理可能在开发指标不再预测外部表现后仍继续优化它。修复这些问题,需要改变那些指导实验和判断结果的程序本身。

三类 L5 实现:

改进搜索程序:STOP 让改进器接收自己的源代码作为优化目标,后续改进器按其能在下游任务上产出的程序质量评分,选中的改进器执行下一轮自我改进。

改进继承者评估:RQGM 通过评估器协同进化解决这个问题,学习型评估器在一个 epoch 内保持冻结,在预定的边界挑战评估器与独立的基准真相锚点进行比较。

修订研究目标和策略:A-Evolve-Training 对一个 30B 模型进行四轮自主后训练,工作者反馈训练配方变化、检查点评估和失败信息,收集器汇总后由元代理修订下一轮的搜索策略。当开发指标提升但外部收益未跟上时,修订后的策略将工作者引导向能改善外部目标的干预措施。最终排行榜得分为 0.86,顶级人类提交为 0.87。

L5 有两个层次:

结构性 L5:能证明一个由 AI 主导的变更被继承并控制了后续改进轮次。

有效性 L5:能在可比预算和独立评估下,证明修订后的机制产生或筛选出更强的继承者。

目前大多数系统只能达到有界的元改进,跨代次可靠积累的证据仍然有限。


四个应用场景

不同场景的反馈条件差异很大,RSI 的推进速度也因此不同。

图片

科学发现:反馈稀疏、延迟、无法精确归因。当前最强在 L2,部分系统有 L3 特征,L4 和 L5 基本未涉及。

具身智能:经验内生于当前策略,物理试验无法自由复制,L2 是主要前沿,部分系统有 L3 能力,仿真环境中有 L4 协同进化,L5 几乎空白。

软件工程:执行反馈最丰富、最直接,L2 是最强的成熟层级,L3 正在出现,L5 有有界特征但完整实现尚未实现。

医疗健康:试错机会受限,反馈延迟且混杂,结果跨患者群体的可迁移性存疑。L2 是当前前沿,L3 雏形存在,L4 和 L5 基本未探索。


工业实践案例

论文专门讨论了六个工业系统,取其中几个具有代表性的。

Theseus(上海交大 Theseus Labs)

提出了一个四步协同进化循环:重建环境、发现真正的能力差距并生成训练数据、训练任务模型、迭代环境产出更多任务。初步实验中,相比噪声工作区,干净工作区让所有八种模型配置的通过率提升了 21.7 到 51.6 个百分点(a)。在工作区重建后加入集合地图和事件日志,五种固定配置的评分提升了 18.65 到 39.67 个百分点(b)。

图片

Humanlaya

建立了内外两层循环。内层修复当前批次数据,外层跨批次更新质量控制系统本身,将规则、提示、少样本示例和技能作为持久改进目标。从 V0 到 V4 四轮更新后,在 600 个排除于更新过程的任务包上测试:关键缺陷率从 9.0% 降到 3.7%,平均人工处理时间从 48 分钟降到 27 分钟。

Tencent Hunyuan Hyra

核心是一个经验库(Experience Bank),保留比普通文本记忆丰富得多的状态,包括过去的解决方案代码、生成物、执行日志、分数和评估器反馈。它还将这个逻辑延伸到评估本身:对于开放式任务,当初始评估器不完整或可被利用时,累积的搜索经验可以修订评估机制。

图片

八个核心挑战

论文归纳了未来 RSI 的八个主要研究方向,概括如下:

跨组件诊断和协调改进。观察到的失败很少直接指向应该改变哪个组件,错误溯源和多组件协调搜索还缺乏系统方法。

学习者条件化的经验获取和可靠学习信号。可验证性、当前学习者的难度估计和真实学习收益是三个不同的属性,现有系统很少同时满足。

持久状态管理和可靠复用。技能被保留不代表后续智能体会从中受益。检索失败和执行不忠实是两种常见模式。技能库的持续增长还会带来检索质量下降(Library Drift 现象)。

领域特定反馈下的受控适应。科学、具身、软件、医疗四个场景对验证的要求根本不同,需要针对提议变更规模匹配适当的验证流程。

改进机制的可信演化。改变评估器意味着不同轮次的分数可能无法对比。评估器改进需要同时保留独立的参照锚点和修改前的分数记录。

继承改进能力的长期评估。区分"当前代理更强"和"产出更强继承者的程序"需要专门设计的实验,现有基准几乎没有覆盖这一维度。

资源感知改进与人机协作。更多并行试验可以提升表现,但这是改进策略变好了还是算力更多了?两者需要分离计算,人类审查的成本也要纳入统计。

跨轮次继承的可复现基础设施。继承者需要知道改进是怎么得来的,包括失败的分支和证据成立的条件。Agent-Native Research Lab 提出的 ARA 格式保留了形式逻辑、可执行代码和探索图,相比传统论文格式,问答准确率从 72.4% 提升到 93.7%。

写在最后

论文的结论很简单:

自主度的五个层次,代表的是 AI 逐步接管改进循环的过程。L1 到 L2 到 L3,边界依次是"持续"、"策略选择"、"经验获取",L4 是部署阶段的适应,L5 是改进机制本身变成可继承的对象。

更高的自主度不等于更好的改进过程。搜索低效、反馈不可靠、评估器被利用、迁移失败,都可能让自主度的增加变成负担而非收益。

当前状态:

L1 和 L2 已有相当数量的系统支撑,工业界的实践也在推进。L3 和 L4 高度依赖具体领域,大量工作仍在仿真环境中。L5 的有效证据集中在有界原型和少数工业系统的初步实践。

人类构建的最后一个 AI,这个词现在还只是一种愿景。但通往那里的路,已经被分成了五段。

--end--

最后记得⭐️我,每天都在更新:如果觉得文章还不错的话可以点赞转发推荐评论

/...@作者:你说的完全正确(YAR师)

文章标签模型发布应用落地智能体
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多