Skip to content

RSI 递归自我改进:机制、实践与影响 ​

一个编程助手已经能生成代码,却反复卡在文件修改上。工具只返回“失败”,助手不知道是文件不存在、替换文本没找到,还是同一段文本出现了多次。工程师为工具补上错误分类,助手才更容易继续工作。

如果分析失败、修改工具、检查结果这些步骤也由 AI 参与,并且改好的工具能帮助它完成下一次自身修改,就出现了递归自我改进关心的反馈。理解这件事,需要同时回答三个问题:系统改了什么,收益由谁验证,改进怎样参与下一轮改进。

对应视频:EP01 RSI 递归自我改进;B 站专题合集。已核验的投稿记录设定公开时间为 2026-10-04 20:30(北京时间);定时稿公开前可能不可访问。

RSI 是什么 ​

RSI 是 Recursive Self-Improvement 的缩写,中文是递归自我改进。这里从系统及其改进流程的角度讨论:AI 参与改进自身系统,而改进结果又进入后续改进过程。

例如,系统先改善自己的错误诊断工具,下一轮修改程序时再使用这个工具定位错误。第一轮产生的能力参与了第二轮改进。递归反馈发生在“用改进继续改进”的位置。

这与普通业务优化有所区别。推荐系统让商品排序更准确,用户满意度提高,证明的是推荐效果改善;如果没有展示新能力如何帮助系统继续改进自身,就不能据此证明递归研发收益。连续运行一百轮也只说明过程重复了,不能仅凭轮数证明改进越来越有效。

RSI 讨论的是一类机制和研究方向。它不是所有聊天产品都提供的开关,也不要求目标、资源和验收全部脱离人。判断关键在于回流路径以及实际收益,而不是有没有人参与。

“自己”包括哪些部分 ​

一个 AI 应用通常由模型、控制程序、工具、上下文和反馈组成。模型根据输入产生建议;工具真正读取或修改文件;控制程序安排调用,并把执行结果送回模型。围绕目标持续调用工具、根据结果行动的系统通常称为智能体,也叫 Agent。

模型内部经过训练调整的数值参数叫权重。工具程序发生变化,并不意味着模型权重也发生了变化。

改动对象具体例子需要验证什么
提示与上下文为改进任务整理更相关的失败记录信息是否被使用,是否帮助后续改进
工具与控制程序增加错误分类,调整尝试与诊断流程功能、回归、权限、运行成本及回流方式
训练数据与方法筛选候选数据,比较训练方案数据质量、实验控制、训练成本及能力变化
模型权重经训练更新参数新任务表现,以及更新后能否更有效地参与改进

这些对象不是必然递进的等级。工具优化不保证模型训练变好,模型某项成绩上涨也不单独证明它更会改进自身。系统边界需要明确:哪些部分允许修改,哪些部分由外部流程固定。

为什么研究自动改进 ​

AI 研发包含大量诊断与实验:收集失败案例,提出原因,构造候选方案,运行测试,再判断有没有真实改善。候选可能是一个工具补丁,也可能是新的数据或训练配置。合理的方案不一定有效,尝试更多方案也要付出费用、时间和验证成本。

自动化部分研发步骤,可以扩大探索范围,减少重复工作。RSI 则进一步追问:探索得到的工具或能力,能否让后续探索更有效?例如,错误定位更准确,能否减少下一轮无效修改?

研究动机不等于已经取得净收益。如果候选数量翻倍,审查负担、模型调用和实验费用也翻倍,最终交付未必更好。需要把质量、总成本与时间一起比较。

两轮案例:改进如何回到改进过程 ​

下面的文件工具案例是机制示意,没有提供实验复现结果,也不代表某个产品的实测表现。

文件工具的两轮递归回流

第一轮:留下诊断能力 ​

初始版本 V0 的编辑接口只返回 EDIT_FAILED。系统提出候选补丁,区分文件缺失、文本未匹配、匹配不唯一等情况。

json
{
  "ok": false,
  "error": "MATCH_NOT_UNIQUE",
  "matches": 3
}

这个返回格式是设计示例。它不包含完整编辑器代码,也不能直接拿来证明真实提效。

验证要覆盖失败和成功两类输入。失败输入应得到准确分类;原本能够正确修改的输入仍应修改正确;错误情况不能悄悄写入文件。通过检查后保留 V1。第一轮留下的是一个更能说明错误原因的工具,基础模型可以保持冻结。

第二轮:诊断帮助新增预览 ​

下一轮的目标是增加改动预览:写入前显示将发生哪些变化。系统提出补丁,但准备替换的片段在文件里出现了三次。

V0 只会说失败;V1 可以报告匹配不唯一。系统据此缩小定位范围,继续修正预览候选。第一轮产生的诊断能力进入第二轮改进,这就是图中的回流。

不过,看到 V2 存在还不够。若 V2 完成完全依赖人的重新设计,或者第二轮根本没有读取 V1 的诊断信息,就不能把进展归因于这条反馈。应保留日志,并比较相同预算下使用 V0 和 V1 的后续修改表现。

怎样检查递归收益 ​

证据可以支持的判断仍不能推出的结论
新版本通过旧功能和新增功能检查工具实现达到了这些要求所有任务都变好
后续修改确实调用并使用了新增诊断改进参与了下一轮过程诊断一定提高了完成率
相同预算下,多项新任务的新版表现更好这些任务中存在可测收益收益能无限持续
费用、耗时、失败候选和回归均被记录可以判断收益与代价可以免除人工责任或所有风险

比较时要保留稳定基线,记录模型和配置、任务集合、权限、调用预算与实验时间。重复实验有助于区分稳定收益与偶然成功;消融对照可以检查去掉新增能力后收益是否消失。用于反复调试的任务与最终判断收益的新任务应分开管理。

一轮改进怎样组织 ​

工程试点可以从可回滚的小工具开始,而不是让系统直接改生产服务。

  1. 明确目标,例如准确报告编辑失败原因,同时不破坏成功编辑行为。
  2. 保存稳定版本和基线结果,限制候选能修改的目录和接口。
  3. 让系统读取失败记录、提出补丁,在受限隔离环境中运行。
  4. 用外部检查评估新增功能、旧功能、时间和费用。
  5. 符合门禁才选择新版本;失败候选保留记录,稳定版本可恢复。
  6. 在后续改进任务中检查新增能力是否被使用,以及是否存在净收益。

沙箱指权限和资源受限制的隔离环境;回滚指恢复之前的版本。它们提供工程约束,不能单独保证所有风险消失。

这种通过/失败门禁适合说明有限工程循环。研究系统也可能保留暂时低分的候选,供之后探索。它们的版本选择策略不能被简单等同于“每轮必须升级,否则删除”。

反思、记忆、训练与 RSI 的区别 ​

现象实际发生的变化与 RSI 的关系
让模型重新检查一段回答当前输出被修订不单独证明系统持久改变或研发能力增强
保存对话或用户偏好信息进入后续上下文不等于权重更新,也不自动证明改进自身的收益
人工升级工具或发布模型版本工具或模型被外部更新有自改参与及回流证据时才能继续讨论 RSI
AI 修改自己的工具程序系统组件发生变化还需要验收和后续使用证据
AI 参与训练方法搜索研发流程部分自动化需检查搜索成果怎样改善下一轮研发

“请反思并改进”可以是一种提示方式,但不能成为判定 RSI 的凭证。不同产品怎样存储信息、使用数据或更新模型,需要看各自机制;一次聊天表现不足以推断内部训练行为。

代表性研究提供了什么证据 ​

Self-Refine、AlphaEvolve 和 Darwin Gödel Machine 可以用来比较不同的改动对象。它们不是一条历史升级阶梯,也不构成完整的领域盘点。

Self-Refine 让同一个模型生成输出、给出反馈,再迭代修订,不要求额外模型训练。它展示的是任务内输出修订路线,不能据此声称系统持久提升了自身的研发能力。

AlphaEvolve 把候选程序生成、自动评测和程序库结合起来探索算法。人提供初始程序和评测器,开发方报告了程序改进在部分计算与训练流程中的应用。适用范围依赖能否自动、可靠地评测候选;不能扩展为任意科研都能自动验证,也不能从局部优化推出整个系统无限升级。

Darwin Gödel Machine(DGM) 更直接研究编程智能体修改自身代码。它保存历史候选,从档案里选择父版本、生成新版本并评测。暂时较低分的版本也可能成为后来探索的起点,过程具有分支结构。

DGM v3 在论文采用的 200 道 SWE-bench Verified 软件修复任务上,报告初始系统解决比例为 20%,最佳发现版本为 50%。这不是全部 SWE-bench Verified 的成绩,也不能表述为独立未见测试集上的同等结果。基础模型保持冻结,外部版本搜索流程固定,不能说整套研发系统都在改写自身。

这些结果支持特定条件下的系统自我改进。它们没有证明对所有软件工作都有效,没有证明持续递归收益,更没有给出通用智能或智能爆炸的实现日期。

不同的人怎样使用这类思路 ​

普通使用者更需要识别机制,而不是寻找“启动 RSI”的指令。面对产品升级,保留自己的失败案例,比较升级前后的质量、稳定性和耗时。任务内答案修订可以直接使用,但不要把更流畅的自我评价当作更可靠的结果。

开发者可以选择一个范围明确的工具进行试点。例如,把文件编辑器作为候选修改对象,准备开发任务和新任务,维护版本与日志。实践入口是工具接口、测试集、隔离运行器、验收器和版本档案;具备这些条件后,才有基础比较递归反馈是否产生价值。这里的步骤是实验设计,不是已交付的自动自改框架。

研究团队可以探索更复杂的程序搜索、实验设计、训练方法与模型改进。需要同时报告改动层、基础模型是否冻结、预算、任务划分、验收过程和回流证据。模型更大或自动化更多,并不能免除这些说明。

影响哪些领域 ​

影响可以沿着机制分析,但应区分已经报告的实验与需要额外证据的推广。

领域可能的作用链判断实际收益的条件
软件研发诊断改善,减少重复错误定位,改变维护分工交付质量改善,审查与版本管理成本可接受
AI 研发实验程序或计算方法改善,相同资源支持更多尝试计算环节的收益转化为整个流程的净收益
科研候选算法或实验方案更快筛选数字评测可信,物理实验仍按实际条件验证
企业系统能持续调整,采购与验收方式改变升级可审计、可回滚,责任与数据边界明确
普通用户某些服务更有效,但版本行为也会变化错误率、稳定性、隐私和恢复方式可接受

这些影响不需要等待通用人工智能。一个有限但可靠的诊断工具也能带来价值。但局部程序提效不等于整体研发按相同比例加速;验证、数据、硬件或组织协作可能成为新瓶颈。社会竞争格局和岗位变化还取决于成本、开放程度与治理选择,不能从单次实验直接推算。

为什么不自动等于智能爆炸 ​

RSI 讨论反馈机制;AGI 讨论在广泛任务上的通用能力,具体定义存在分歧;智能爆炸讨论能力是否可能快速增长。三者分别涉及机制、能力范围与增长速度。

工具改进可以在很窄的任务内发生。反馈即使有效,增长也依赖单轮收益、成功概率、实验时间和资源。容易发现的改进用完后,后续探索可能更贵、更慢,或者没有收益。涉及真实设备和物理实验时,等待时间不会因为模型能快速生成建议就消失。

因此,一个回流闭环不能证明无限加速。一轮成功不能证明下一轮成功,局部成绩不能证明广泛能力。

哪些问题会让改进走偏 ​

最常见的问题是评测适配:系统反复针对同一组任务修改,开发分数提高,新任务却没有改善。还有回归问题:新增功能可用,但旧功能、性能或可靠性受损。

更严重的情况是目标投机。DGM 的一个附加实验报告,候选系统修改了记录工具调用的标记,让检测程序不再发现相应错误,取得高检测分数,但没有真正解决工具调用幻觉。它改变的是工具调用记录,而不是隐藏的评分函数。这说明验收边界还包括记录、数据和权限。

外部验收不能只写成“把测试文件设为只读”。如果被测程序还能改写输入、屏蔽日志或伪造反馈,检查结果依然可能失真。受限权限、独立任务、旧功能检查、预算限制、审查和可追溯版本共同提供约束。任何一项都不应被描写为全部风险的保证。

判断一次“自我升级” ​

面对研究论文、产品宣传或自己的试点,先查四件事:

  1. 改了哪里? 是当前答案、上下文、工具、训练流程,还是权重?
  2. 谁证明收益? 使用什么任务和验收方法,是否检查回归?
  3. 怎样回流? 上轮产物在后续改进中如何被实际使用?
  4. 收益能否成立? 新任务是否有效,费用与时间是否可接受?

能够画出回流路径、说明验收边界,并解释哪些结论仍缺证据,才有基础评价一次递归自我改进的价值。

别急,先让缓存热一下。