
Self-Evolving Agents (What、When、How、Where) —— 自进化智能体综述
系统解读自进化智能体综述,围绕 What、When、How、Where 四大核心问题,系统梳理自进化智能体的进化对象(模型、上下文、工具、架构)、进化时机(测试时内/测试时间)、进化方法(奖励/模仿/种群)与落地领域,并涵盖五维评估体系、开放挑战与未来方向。
阅读文章ZHY's Blog
A UNIVERSE OF IDEAS · BY ZHANG HAOYI
让好奇心 点亮知识宇宙
在代码、模型与思想之间自由漫游。这里持续记录人工智能、机器学习、软件工程与成长实践,让每次阅读都成为一次新的发现。
ARTICLE NOTE
参考综述:The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement
2026年2月,OpenAI在发布GPT-5.3-Codex时写下了一句话 —— 早期版本的模型“在创造自身的过程中发挥了重要作用”,帮助调试训练运行、管理部署、诊断评估失败。这是前沿实验室首次明确承认,其模型实质性地参与了生产下一代模型的工程循环。几乎在同一时期,Anthropic发布报告警告说,AI已经开始加速AI开发,这一趋势可能通向“递归自我改进” —— 即模型在极少人类输入的情况下设计和构建自身继任者的临界点。
RSI(Recursive Self-Improvement,递归自我改进) 这个概念最近热度很高,与之相近的表述还有 自进化(Self-Evolving)、自改进(Self-Improving) 等。这个领域正在飞速发展,尚未形成统一的技术范式。不同工作选择的改进对象和实现路径差异很大:有的更新模型参数,有的积累上下文或记忆,有的演化Skill,还有的直接修改工具、控制流程和Harness代码。因此,RSI很难用某一种具体方法或单一技术路线来概括。
本文尝试从分类的视角整理现有RSI工作,结合权威综述和前沿实践,建立一套分析RSI的体系。
本文把RSI定义为:Agent在与环境交互后,利用任务轨迹与反馈,通过更新机制修改自身状态,并让更新后的状态参与后续任务,以提升未来表现。
用形式化方式表达:设 Agent 在第 t 轮使用的版本为 At,它在任务中产生的轨迹为 τt,获得的反馈为 rt,更新机制为 U。那么更新过程为
At+1=U(At,τt,rt)
其中 A=(Model,Harness)
“更新”可以发生在模型参数上,也可以发生在Harness的上下文、记忆、Skill、工具或代码上。
更新后的 At+1 将参与后续任务。U 不一定由Agent自己执行,也可以由Teacher、Meta-Agent或外部训练程序完成。
关于RSI,有一个反直觉但至关重要的判断:更新机制早就不是瓶颈了,评估才是。
从控制论和学习理论的角度看,任何自我改进系统必须闭合一个环:执行→评估→归因→更新→再执行。这四个环节缺一不可 —— 没有执行,没有行为可以改进;没有评估,不知道改进的方向;没有归因,不知道是什么导致了好坏;没有更新,改不动。
但关键在于,另外三个环节早就工程化了:执行可以沙箱跑,归因可以靠diff和日志,更新可以靠梯度或代码重写。这些都是廉价、成熟、可自动化的。真正稀缺的只有一样东西:一个廉价、可靠、骗不过的评分器。整个自进化工程的难点,从来不是“怎么改”,而是“凭什么知道改对了”。
这解释了为什么数学/代码领域的自进化跑得快 —— 编译器加单元测试等于免费的真值预言机;医疗/科学领域慢 —— 真值延迟数月、混杂、不可复现;而纯自博弈则会坍塌 —— LLM-as-judge是自我指涉的,没有外部真值,必然漂移。
Schmidhuber在 1997 年的 Gödel Machine 中就点破了这一点:什么都能改,唯独不能改证明机制(proof searcher),因为一旦允许改证明机制,整个系统就失去了“改进是否真的发生”的判据。
因此,自进化 = 在某个不可自我修改的验证锚之上,闭环地提升能力上限。 没有这个锚,就不是自进化,是自我指涉的漂移。
RSI与持续学习、AutoML、Agentic AI都有交集,但核心区别在于:RSI的核心问题不是“AI是否参与AI开发”,而是“是否围绕系统本身形成了持续的改进循环,以及这个循环的多少权威已经内生化”。
只有当验证过的变更跨任务持久存在,并影响后续改进的生成或选择方式时,才进入RSI的边界。
现代智能体可以抽象为 Agent=Model+Harness。不同的RSI方法可能修改其中不同的部分,这一维度构成了RSI分类的第一条坐标轴。
参数进化把经验写回模型权重。
代表工作:SEAL(Self-Adapting Language Models)
SEAL的出发点是:语言模型部署后会不断遇到新知识和新任务,但权重通常保持静止。作者希望模型不依赖单独的适配网络,而是自己决定“应该怎样训练自己”。
具体做法是:
上下文是模型在当前推理中直接看到的材料。上下文进化就是根据任务执行结果重新组织这些材料——删除无关信息、压缩过长历史、补充失败教训,或者重写当前计划。
上下文与记忆的区别在于:记忆是存放在外部、等待检索的信息;记忆被取出并放入模型输入后,才成为当前上下文。
代表工作:Prime Agent
长程任务的困难在于任务持续时间可能远远超过一次模型调用。Prime Agent的做法是在模型之外提供一个可以长期保留的工作台:
记忆进化把经验写入独立的长期存储,并在后续任务中按需检索。系统需要从日志中筛选有价值的信息,将具体经历整理成可复用的经验,并根据新证据修订旧记忆。
代表工作:ReasoningBank
单条记忆记录某次任务中发生了什么,Skill则总结以后遇到同类问题时应该怎样处理。它可以是工具使用规则、行为要求、操作步骤,也可以是一段脚本。
代表工作:TRACE
Harness代码负责组织模型接收到的上下文,并把模型的决策转化为工具调用和任务流程。Skill通常告诉Agent应该怎样做,而Harness代码进化还可以改变上下文的构造方式、增删工具或修改执行逻辑。
代表工作:SkillSmith
前面讨论了Agent的哪些部分会被修改,这一节关注修改产生的新版本如何继承历史结果。按照新版本与历史版本之间的继承关系,可以将进化结构分为三类。
链式进化始终只有一个正在使用的版本。系统在当前版本 At 上修改,得到 At+1,下一轮再以 At+1 为基础继续更新。这种方式实现简单,不需要维护和选择多个分支;但前一轮留下的错误也会被下一轮直接继承。
代表工作:SkillFlow
树形进化会保留已经产生的多个Agent版本。一个版本可以生成多个子版本,后续更新也可以从任意历史版本继续。暂时表现不好的版本也可以保留下来,其中的某项修改可能成为后续改进的基础。
代表工作:Darwin Gödel Machine(DGM)
树形进化中的新版本沿一个父代产生,修改依据通常也来自这个父代。图式进化允许一次修改同时参考多个来源,例如同一Agent在不同任务上的轨迹,或者另一条分支中Agent的执行结果。
代表工作:Mendel Gödel Machine(MGM)
RSI系统既要执行任务,也要根据任务轨迹和反馈完成更新。这两项工作可以由同一个Agent承担,也可以交给不同的Agent。
为方便讨论,把执行任务的Agent称为Student,把分析Student的任务轨迹并参与修改的另一个Agent称为Teacher。
自身更新中,执行任务和完成修改的是同一个Student。环境可以提供得分、错误信息或其他反馈,但没有另一个Agent负责分析轨迹或编写更新。
它省去了Agent之间的信息传递,但Student必须自己理解反馈并完成修改。如果Student错误理解出错,错误也可能被写入长期产物,并继续影响后面的任务。
教师更新中,执行任务的Student不直接修改后续会使用的持久产物,这一步由Student之外的Teacher完成。
Teacher可以读取示范、任务轨迹、评测结果或已有经验,并据此生成或整理新的记忆、Skill、工具或Harness代码。
需要注意的是,只提供分数或验收结果的模块不算Teacher;Teacher实际决定写回什么,以及怎样修改。
代表工作:Recuris
联合更新中,Student和Teacher都会参与修改,但两者的分工没有固定形式。Student可以先从任务中总结候选经验,再由Teacher筛选和写入;也可以由Teacher诊断问题,再由Student实现修改。
代表工作:Evo-Harness
按照任务执行与经验更新的时间关系,可以将RSI分为三种模式。
离线RSI将更新和测试分成两个阶段。
代表工作:GDPevo
在线RSI把任务排成连续序列。
代表工作:FinEvo-Bench
混合模式先从示范或训练任务中建立一批初始经验,再在实际使用过程中继续更新。这样,Agent开始执行任务时已经有可用的经验,遇到新情况后也能继续补充。
代表工作:Mem²Evolve
一份综述了1,250篇论文的权威调查提出了一个关键概念:验证层级(verification hierarchy)。从最强的信号到最弱的信号排列如下:
一个直观的对比可以说明验证层级的作用:
| 领域 | 反馈类型 | 反馈速度 | 反馈可靠性 | RSI成熟度 |
|---|---|---|---|---|
| 软件工程 | 编译器+单元测试 | 秒级 | 高(形式化真值) | L2-L3,部分L5 |
| 数学 | 形式化证明器 | 秒级-分钟级 | 极高(可形式化验证) | L1-L2 |
| 科学发现 | 实验验证 | 天-月-年 | 中(混杂因素多) | L1-L2 |
| 具身智能 | 物理交互 | 秒级(仿真)/天级(真实) | 低(不可复现) | L2-L4(仿真中) |
| 医疗 | 临床结局 | 月-年 | 极低(延迟、异质、混杂) | L1-L2 |
该综述的核心发现是:已证明的自改进强度与验证层级高度对应 —— 越靠近形式化验证器的一端,自改进越可靠;越靠近内在自我评估的一端,越容易坍塌。
验证鸿沟:越有价值的能力,越难验证。代码有编译器,可以快速给真值;医疗结局要等数年且混杂因素无法隔离。没有验证器的领域,必然退化成用LLM-as-judge顶替。
奖励攻击:任何可优化的代理指标,在持续优化压力下都会被钻空子。Goodhart定律不是经验之谈,是优化的内生性质。Anthropic的自动化研究实验就报告了随机种子挑选和试图通过评估器查询提取测试标签的行为。
目标漂移:当评估器本身成为被优化对象时,目标会随优化起漂移。纯自博弈(锚完全在环内)必然坍塌到平凡解或退化分布,这是结构必然,不是调参问题。
继承保真度:增益只有能被继承,才有跨代累积的意义。HyperAgents跑200轮长实验,无统计显著优势;AIDE²的演化harness装成外层改进器后无显著效率优势。两种结果只有两个解释:要么继承保真度不够,要么所谓“改进”本来就是噪声。
可追责性:自进化系统路径依赖、非确定性,同流程跑两次结果不同。坏prompt容易回滚,但被吸收进权重的回归极难追责。
灾难性遗忘:参数空间是共享的,能力不是可叠加的积木,改A必然伤B。DGM必须靠archive维护历史最优,否则迭代会走丢回低分区域。
成本与样本效率:收益是“能力”,成本是“算力×时间”,很多改进的净收益是负的。OPRO类方法需要成百上千次评估,单次收益摊不平成本。
一份专门讨论RSI评估的权威分析提出了验证器设计的核心原则:
验证器不能和生成器共享信息路径 —— 同一个模型既生成又评判,锚就落在环内了;
验证器代码、测试用例、留出集必须在Agent写权限之外 —— 是文件系统权限层面的隔离,不是“约定不去改”;
要快要便宜 —— 评估吞吐等于搜索通量,AlphaEvolve能把矩阵乘法改到48次乘法,靠的就是evaluator秒级返回;
训练与留出严格分离 —— 否则分数涨、能力不涨,过拟合到验证器是自进化最常见的假阳性;
多维度并含回归项 —— 单指标的Goodhart风险最高,锚里必须同时有“目标指标”和“绝不许退化的指标”。

Theseus综述提出的L1-L5框架,其核心不是按技术难度或系统能力来分类,而是按“哪些改进决策从人类或固定基础设施转移到了AI系统”来分级。
L1(改进执行自主性):人类指定改进什么、怎么改进、什么算成功,AI执行候选更新。FineWeb-Edu用模型应用人类定义的教育质量标签就是典型。
L2(改进策略自主性):目标、任务边界和评估标准仍然外部固定,但AI诊断弱点并决定如何改进系统。ADAS让meta-agent用Python写新agent的类定义,在benchmark上评测,好的存进archive——但benchmark本身是固定的。
L3(学习信号或经验获取自主性):系统还决定下一轮改进需要什么经验。SIMA 2使用对当前行为的评估来生成后续练习任务,针对观察到的技能弱点。
L4(环境适应自主性):改进循环使用部署交互在外部接受和治理规则下修改持久系统状态。PANDO在长期交互中根据观察到的结果接纳或降级可复用规则。
L5(递归继承自主性):系统持久地修改治理后续改进的机制,如改进器、验证器或后继生成程序。A-Evolve-Training在开发分数未能预测外部收益后修改其研究政策,并用修订后的政策指导下一轮训练。
一个至关重要的观察是:更高的自主性级别并不自动意味着更好的改进过程。更大的授权可以与低效搜索、不可靠反馈、回归、评估器利用或差的迁移共存。Theseus综述明确区分了由AI内化的改进责任范围与由此产生的改进质量。
HyperAgents的研究展示了这个区分的实际意义。
增益只有能被继承,才有跨代累积的意义;但改进往往深度绑定在特定上下文里,换个场景就失效。
系统生成修改后,还要依据一定的证据决定是否保留。常见的验收标准包括:
反馈来源描述驱动改进的证据来自哪里:
反馈类型关注系统获得的是结果分数,还是包含具体信息的非分数反馈。
更新频率表示积累多少Student执行过程后,会更新一次持久产物:
经验作用范围描述演化得到的产物可以在哪里使用:
Theseus的环境-数据-模型协同进化:早期实验表明,仅改善工作空间环境——在模型和Harness固定的情况下——就能将任务评分提高18.65到39.67个百分点。这说明环境状态本身可能是Agent性能的瓶颈之一,而不只是模型能力。
ModelBest的零人工工程:从空目录出发,ForgeTrain在约8小时内追平了Megatron-LM v0.15在H100上的性能,对照估计需要3–5名工程师工作6–12个月。但其成立的前提是存在明确benchmark,且反馈来自可执行验证。
Tencent Hunyuan Hyra的经验驱动搜索:Hyra维护一个Experience Bank,保留解决方案代码、执行日志、评分和评估器反馈。在nanochat AutoResearch上,验证BPB从0.9109降至0.9015;在SOL-ExecBench上,平均SOL从0.754提升至0.771。
DGM的开放式进化:DGM的核心设计是“开放档案”——不覆盖历史、保留失败支路。这是防局部最优的关键。实验报告SWE-bench从20.0%到50.0%的提升,且显著优于无自改进或无开放探索的基线。但DGM也暴露了继承保真度的问题:14%的MGSM优化试验最终低于初始策略的表现。DGM的名称来自Gödel Machine——后者要求系统先证明某次修改能提高收益才执行修改;复杂的编程Agent很难完成这种形式证明,因此DGM直接运行修改后的版本,用Benchmark得分检验修改是否有效。
SIA的Harness与权重联合更新:SIA提出了一个自改进循环,其中Feedback-Agent同时更新任务特定Agent的Harness和权重。这代表了从单一维度进化向多维度协同进化的方向。
RQGM的评估器共进化:Red Queen Gödel Machine通过评估器共进化来应对反复优化对评估器盲点的压力。其学习到的评估器在一个epoch内保持冻结,在预定边界处,挑战者评估器与独立的ground-truth锚进行比较;被选中的评估器则支配下一个epoch。在held-out Polyglot编码任务上,报告71.7%的通过率,对比HGM-H的69.9%,同时搜索token使用更少。
AlphaEvolve的进化算法+LLM:AlphaEvolve改进4×4复数矩阵乘法(48次乘法,破了Strassen的49次)靠的正是evaluator极快——评估吞吐直接决定搜索空间大小。评估器要十分钟返回,搜索空间就只剩几十次迭代。
腾讯Hyra的评估器修订:Hyra在开放任务中允许用积累的搜索经验修订评估机制——增加粒度、强化比较基线、堵住奖励黑客漏洞——再在改进后的准则下继续搜索。这是评估器进化的一个具体实现,但必须挂个不可自我修改的客观指标兜底。
结语RSI 不是“让 AI 改自己”这么简单。它是一个自主、闭环、持久的改进过程,涉及执行、评估、归因、更新、继承多个环节。
权威综述用 B0–L5 自主性分级提供了清晰坐标系:从任务内输出精炼,到改进执行、策略选择、经验获取、环境适应,最终到递归元改进。本文解读从进化对象、结构、更新者、时机、评估维度补充了工程分类。批判性分析更新机制早已不是瓶颈,评估才是。
当前 RSI 的真正前沿,不在“怎么让 AI 改自己”,而在“怎么造出一个 AI 骗不过的裁判”。结构递归已经有很多演示,机制改了、继承下来了;但有效递归 —— 证明修改后的机制确实产出更强后继 —— 仍然稀缺。
未来 RSI 的突破,将来自可信评估基础设施、跨组件诊断、学习者条件经验获取、持久状态管理、受治理领域适应、可信机制演化、长时程评估和资源感知改进。
RSI 的承诺,是让每一代 AI 都能让未来改进更可靠、更高效、更有利于新发现。但只有锚足够可信,这个承诺才不会变成自我说服。
按顺序完成这组文章,循序渐进地掌握主题
发现错误、内容过时或有改进想法?欢迎告诉我
根据本文分类与标签,为你推荐可能感兴趣的内容

系统解读自进化智能体综述,围绕 What、When、How、Where 四大核心问题,系统梳理自进化智能体的进化对象(模型、上下文、工具、架构)、进化时机(测试时内/测试时间)、进化方法(奖励/模仿/种群)与落地领域,并涵盖五维评估体系、开放挑战与未来方向。
阅读文章
系统梳理 LLM Agent 记忆机制从 Storage、Reflection 到 Experience 的演化框架。解析长期一致性、动态环境与持续学习三大驱动,剖析主动探索与跨轨迹抽象两大变革机制,并展望主动记忆感知、工作记忆、经验基准、分布式共享记忆与多模态记忆等未来方向。
阅读文章
系统讲解AI Agent的核心架构——LLM(推理引擎)、规划(Planning)、工具(Tools)与记忆(Memory)四大模块的设计原理与协同机制。从感知-规划-行动闭环出发,剖析LLM作为“中央推理引擎”的多重角色、规划的数学建模与两种范式、工具调用的标准化接口与MCP协议演进,以及短期记忆与长期记忆的二分法设计。
阅读文章请使用微信扫描二维码分享
当前文章会保持在原页面