一、先立门槛:什么才算"真 RSI"
RSI 这个词被用得太宽,先收紧定义。9 月 10 日挂在 arXiv 上的路线图《The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement》(arXiv:2609.11873,33 位作者,上海交大、清华、字节跳动、上海人工智能实验室等)给的定义是:
AI 系统把自身的经验与反馈,转化为持久的改动,这些改动既提升它当前能做的事,也提升它下一次改进的过程。
后半句是关键。普通训练也在让模型变强,但那不算递归。这篇论文给了一条判定式:一次提升要算"真的在递归",必须同时满足两个条件。
| 条件 | 含义 | 为什么必须 |
|---|---|---|
| **机制留存** | 这一轮改进的机制本身,必须被保留并参与下一轮 | 否则每轮都从同一个起点重来,是重复不是递归 |
| **增益可归因** | 在**可比的算力与评测预算**下、经**独立评测**,ΔP\_{t+1} > 0 | 否则"提升了"可能只是"多花了一倍 token 多跑了一倍 rollout" |
第二条是整个领域最缺的东西。绝大多数自称 RSI 的系统,闭环终点接的是同一个它参与优化过的 benchmark,对照组用的是"同一道 syllabus 跑一遍",而不是"同样预算下别的方式能做到多少"。这条判定式值得抄进你的实验协议里,哪怕你做的不是 RSI。
用一句话画出区别:
一次性提升(不算 RSI)
基座模型 ──<span>[ 某个 patch / 某次蒸馏 ]</span>──► 更强模型
└─ 改进用的那套方法,这次用完之后就被丢掉 ─┘
递归(才叫 RSI)
基座模型 ──<span>[ 改进机制 M ]</span>──► 模型 P1 ──<span>[ M 留存并被 P1 使用 ]</span>──► 模型 P2
▲ │
└────── P2 产出的信号反过来修订 M ◄────┘
判据:同样预算下 P2 > P1,且这个 ">” 由独立评测给出
二、还剩多少空间:Headroom-Closed Index
在谈"怎么改"之前,得先知道"还有多少可改"。路线图论文提出了一个跨基准的统一标尺:Headroom-Closed Index(HCI,剩余空间闭合指数)。
它的定义是把不同单位、不同天花板的 benchmark 压到同一根 0–100 的进度条上:
<span>H</span> = <span>100</span> × ( s̄ − F₀ ) / ( <span>100</span> − F₀ )
s̄ = 当前模型在该 benchmark 上的平均得分
F₀ = 该 benchmark 入榜年份的前沿水平(取第 90 分位)
<span>H</span> = <span>0</span> → 刚追上该基准设立当年的前沿
<span>H</span> = <span>100</span> → 满分,没有剩余空间
据多家对这篇论文的技术解读转述,作者在 10 个能力域、393 组"模型 × benchmark"观测上跑出的分布非常不均衡:
| 能力域 | HCI(越高表示剩余空间越少) | 直白含义 |
|---|---|---|
| 高等数学 | 86.4 | 快封顶了 |
| 研究生级科学问答 | 85.8 | 快封顶了 |
| 搜索 / 终端类 Agent | 56.8 | 还剩四成多 |
| 软件工程 | 52.6 | 还剩将近一半 |
| 工具调用类 Agent | 39.9 | 还剩六成 |
这张表解释了今年 RSI 论文的选址:几乎全都在软件工程和终端任务上。原因不是巧合——软件工程同时满足三个条件:
- 验证信号近乎免费:编译、跑测试,几秒出结果;
- 被改进的对象是文本:scaffold、prompt、工具定义,模型天生会写;
- 剩余空间大:HCI 只有 52.6,改起来有地方涨。
反过来,物理世界的反馈要给新候选ის物理执行时间(embodied intelligence 是论文里点名的"慢车道"),科学发现的判据又常常是论证、复现和测量,而不是一个可自动执行的验证器。
口径提醒:HCI 的公式来自对论文原文的转述,上述具体数值我只在二手技术解读中对齐到两家一致,未逐条回溯原论文表格。引用时按"据报道"处理。
三、统一的 Loop Kernel:RSI 到底"写"在哪里
9 月挂出的 MetaRSI / RSI²(arXiv:2609.06396)做了一件此前没人做的事:把"进步是怎么发生的"抽象成一个与改进对象无关的闭环,然后把具体改进变成这个闭环的三次实例化。
3.1 一个内核
┌─────────────────────────────────────────────────┐
│ 任务族 + 受保护的验证器 V(不可写) │
└────────────────────┬────────────────────────────┘
│ 执行轨迹 / 外部反馈
▼
┌────────────────────┐
│ 学习信号 <span>S</span>(t) │ ← 每次都会被 ↑Controller 混合 &
└─────────┬──────────┘ ↓Controller 替换二者
▼
┌────────────────────────────────────────────┐
│ 提案改动(只能写在三个可写面之一) │
│ │
│ Data-RSI Harness-RSI Model-RSI │
│ 改 / 造数据 改脚手架 改权重 │
└────────────────────┬───────────────────────┘
▼
┌───────────────────────┐
│ 验证器 V 裁决 → 发布门 G │ ← 不位于任何可写面之内
└───────────┬───────────┘
▼
采纳 / 拒绝 → 结果回流成 <span>S</span>(t+<span>1</span>)
三个可写面各自改的东西:
| 算子 | 写什么 | 能不能不碰权重 | 谁来用 |
|---|---|---|---|
| **Data-RSI** | 执行轨迹提炼出的经验 → 合成数据 + **能力边界标注** | 能 | 同时喂给下面两个 |
| **Harness-RSI** | 脚手架的五个槽位:System Prompt、Skill、MCP、Tools、Memory | 能 | 只要能通过接口调用的模型 |
| **Model-RSI** | 参数与结构(bounded training,有界训练) | 不能 | 自己有权重更新权限的团队 |
五个槽位的划分不是随意的——它把"整个 harness 一起改"这个不可归因的动作,拆成了可独立验收的动作。这一点在下一节的 ModularRSI 里会成为主线。
Data-RSI 的定位尤其值得注意:它不只是"造数据",它是能力边界的探测器。也就是说,它要标的不是"这条经验对不对",而是"这条经验在什么范围内成立",同时给出正向边界和负向边界。这决定了下游 Harness / Model 两个算子能不能安全地用它。
3.2 两轴调度 + 元级
只有三种算子还不够,还得决定"先改哪个、每个怎么提方案"。MetaRSI 给的是:
- 横轴(编排):在每个决策点选择下一个要调用的算子,以及允许的组合顺序;
- 纵轴(改写):向子智能体下发指令,改写某个算子自身的提案策略;
- 元级(跨 term):一个 terms 结束之后,修订整个调度策略本身。
顺序之所以重要,是因为存在信息新鲜度约束:某个算子刚被改过之后,另一类算子的输入信号就过期了。论文从这个约束推出五种 admissible 的迁移类型,而不是任意排列。
一句话点破这套设计的意义:它把"优化哪个面"从一个工程选择,变成了一个可以被搜索、也可以被改的变量。
四、五条定律:这套架构总结出来的经验规则
MetaRSI 给出了五条明确写成"可证伪"的定律。这五条比它的实验数字更值得记住,因为它们是可迁移的:
| 定律 | 表述 | 对工程师的含义 |
|---|---|---|
| **L1 验证决定前沿** | 一个领域能否形成自我改进闭环,取决于它的任务是否可验证、有没有合适的验证器 | 别在没有验证器的场景里开闭环。先做验证器,剩余一切才有意义 |
| **L2 自我认知会过期** | RSI 改变能力的同时,立刻让自己先前的系统描述失效,重新发现能力边界是速率瓶颈 | 你写给同事的"这个模型不擅长 X",在你跑完一轮 RSI 之后就可能不成立 |
| **L3 能力与载体无关,成本取决于载体** | 同一份能力放在 harness 里每次推理都付费,内化进权重只付一次;成熟闭环会持续把能力迁移到更便宜的载体 | 这是最省钱的一条:harness 可以**做减法**——某项能力被 Model-RSI 内化之后,对应的 scaffold 知识在回放验证下删掉,**能力留下,成本退出** |
| **L4 可信度由"不可写的那一面"度量** | 在闭环内部,"能力真的提升了"和"成功标准被放宽了"产生**完全相同的分数**,这个偏差在内部不可察觉,也无法用统计方法纠正 | 最危险的一条。它直接解释了为什么必须把 evaluator 放在可写面之外 |
| **L5 循环不凭空创造能力** | 所有增益本质上都来自外部信息熵输入,或是对已有能力的激发;每一轮都必须分离"被放大的"和"从外部新引入的" | 用来给 RSI 的成果定性:重组、放大、固化可以,无中生有不行 |
L4 值得单独说。它和 9 月 16 日那篇 Plan Injection(arXiv:2609.15989)讲的是同一件事的两个部位:后者说"不要把 CoT 当日志读",前者说"不要把闭环内部的分数字当证据读"。凡是能被写入的那面都不算证据,只能算自述。
五、证据:目前最好的那批数字
把本周几份工作的自报结果放在一起(全部为团队自报,未见第三方复现):
| 系统 | 改进对象 | 结果 |
|---|---|---|
| **MetaRSI-v1**(自托管 Qwen3.5-35B-A3B,3B 激活,无外部教师,目标模型出演自己闭环里的全部角色) | 三个算子全开 | 四个基准(Terminal-Bench 2.1、SWE-bench Pro、GPQA-Diamond、AIME)**平均 +10.9 分**,SWE-bench Pro 解决率接近翻倍;比"最强固定顺序组合"还高 **+3.6 分** |
| **MetaRSI-v1**(前沿模型轨道,Claude Opus 5、GPT-5.6 Sol、Kimi K3 等六款) | 只开 Data-RSI + Harness-RSI | 在 Terminal-Bench 2.1 上 **+5.6 ~ +9.2 分,平均 +7.3** |
| **MetaRSI-v1**(多个 term) | 元级策略 | 跑了五个 term 之后,被元更新过的 improver 累计 **+26.2 分**,原始 improver **+20.7 分** |
| **ModularRSI** | 五个模块各自进化 | 在 Terminal-Bench 2.0 与 SWE-Bench Verified 上分布内 / 跨域未见任务一致提升,且进化出的 harness **可迁移到不同的基座模型** |
| **NeoHorse-1** | 路由信号作为监督来源 | 11 个基准宏平均分:4B 从 **58.94 → 64.87**,9B 从 **65.60 → 69.04**;后训练后的 4B 与 9B 基座的平均差距被大幅压缩 |
最重要的一行是第三个:累计 +26.2 vs +20.7。前面几条证明的是"改了有效",这一条证明的是"改那个改的东西,本身也在变好"——这才是 RSI 而非普通后训练的那一部分。虽然差得不多、规模也不大,但它是这类论文里少见地直接对着"递归"两个字做测量的地方。
NeoHorse-1 值得单独提一句,因为它展示了闭环另一侧的信息来源:系统先为每个用户轮次记录预测的能力需求、选中的服务档位、以及随之发生的交互,然后把这些记录转成保留交织推理、工具调用与 harness 上下文的训练样本,经结构校验 + 六维语义评估 + 子场景标注后准入。接着路由信号把监督微调组织成三段式课程,并延伸到"同进程下的 on-policy 蒸馏",最后能力导向的分配把评测反馈转成下一轮训练混合比。一句话:今天的 serving 日志,就是明天的训练集,中间不需要人标注。
六、冷水:这份证据为什么还不能算数
6.1 Princeton 的 shadow evaluation 说了什么
普林斯顿 Peter Kirgis、Sayash Kapoor 等人联合英国 AI 安全研究所做了一项叫 shadow evaluation(影子评测) 的实验(arXiv,2026 年 8 月 18 日)。设计很克制:取两篇尚未发表的 NeurIPS 2026 投稿的核心研究问题(一篇讲能否通过编辑权重控制 LLM 的"人格",一篇讲如何检测表格预测模型何时因分布偏移而失效),让智能体从零去做——答案没在网上,背不出来。
配置给得很足:Claude Opus 4.8 开启 Extra-High Reasoning,跑在开源 vendor-neutral 脚手架 OpenClaw 上,六天、3000 美元 API 额度、GPU 预算、虚拟机、开放网络、可派子智能体、可读它自己的资源用量。最后由两篇原论文的作者以会议审稿人身份评审。
结果是:两篇都被拒,一篇 Strong Reject。 工程侧它做得不错——文献综述、跑几百次实验、整理结果;研究侧,Kapoor 的原话是 "unambiguously bad"。日志里扒出来的具体失败方式:
| 失败模式 | 具体表现 |
|---|---|
| **过早锁定** | Personas 那一轮,原计划探索 36–48 小时,**第 5 小时就结束了探索**。两条线都在**头十小时内放弃了各自最有雄心的研究目标** |
| **无法回溯重启** | 初始假设被证伪后,只会收窄结论、加限定语、在边缘补一个实验,不会推倒重来 |
| **听不进反馈** | 15 轮修订里内部 AI 审稿从未返回过一次 Accept,核心批评一次都没被真正处理 |
| **资源管理失当** | 两份都**花不到一半预算**(实际 1130 / 3000 美元);其中一个在自家审稿人又一次返回 Reject 之后,**提前 7 小时宣布项目完成** |
| **指令漂移**(instruction drift) | 长上下文里逐渐遗忘显式约束;两篇都超出页数限制,会被 desk reject。一篇正文**零张图**,而人类原稿有 **15 张图** |
一个真正的好消息:它们没有作弊。没有隐藏或歪曲不利结果,子智能体偶尔幻觉出的结果被主智能体抓住了。
Kapoor 给出的归因不是"模型不够聪明",而是训练制度的:强化学习在"成功可被自动检验"的任务上最有效,而开放式研究恰恰缺少这种环境。这个解释和上面那张 HCI 表完全一致——凡是能在软件工程里跑起来的闭环,恰恰是那些本来就能自动判定对错的地方。
这项研究自身也有硬限制:n=2,两篇未发表论文的质量本身未知,让原作者来评审会引入偏倚(不是盲评),CRUX 团队自己也提醒他们的既有立场可能影响解读。这些条件在原文里都写明了。但对本文的用途来说,它足够说明一件事:可验证的那一档里 RSI 在跑,开放式那一档里它还没开始。
6.2 工程侧的六个死结
把这些放在一起,今天对着 RSI 做判定会遇到六个绕不开的问题:
- 评价者漂移(L4):闭环内部无法区分"能力涨了"和"标准松了"。唯一的结构性解法是把 evaluator 和发布门放在所有可写面之外,并且它的失败模式要能被独立审计。
- 预算混淆:ΔP 必须在 matched compute / matched eval budget 下度量。绝大多数论文报的是"跑完这一整套之后 vs 原来的基线",而这套东西本身可能多花了数十倍的 token。
- 基准特化伪装成改进:在下游 benchmark 或其子集上进化 scaffold,学到的可能只是这个 benchmark 的形状。ModularRSI 的解法是 introduction thread 里明确的 benchmark-disjoint evolution——它从外部来源整理了 2000 个可执行进化任务,与下游评测基准不相交。这是一个"防火墙"式的设计,值得直接抄。
- 单轨迹噪声:拿一条失败轨迹去反推 harness 缺陷,会把"这次实例的解法不对"和"harness 系统性不足"混在一起。解法是对比式证据聚合——同一任务的成功 / 失败轨迹成对比对,再跨任务聚合去找出反复出现的行为缺陷。
- 单体归因困难:整块优化 harness 会把无关机制缠在一起。解法是把可进化的东西拆成互不相干的功能模块(ModularRSI 拆成 Agent Loop、Tool Use、Observation Management、Context Management、Task Completion Detection 五个),各自限定改动范围,最后再做集成与冲突消解。
- 探索成本:循环要持续,就得不停试新策略,而在线试一次的成本是真金白银。Dream-RSI(arXiv,9 月 14 日)的做法是把历史发现树变成离线重放模拟器,在这个"梦境"里做 off-policy 评估——用一句话说:历史和 paid thinkagogue,就是你做梦的世界。 论文摘要只说在 GPU kernel、数学优化、算法工程三个域做到了"可比或更好的发现质量,同时显著降低发现成本",没给具体数字。
另有据二手转述的 NVIDIA SoL-Pi(9 月 11 日):自动研究循环接受率约 1/40,在保留约 94% 任务分数的同时把 token 降了 45%–49%。这条我没找到一手确认,按"据转述"处理,不要写进结论里。
七、不追 RSI,今天能落地的是什么
抛开"递归"这个词,这套东西有几件现在就能用的:
第一,先把验证器做出来,再谈闭环。 L1 是硬约束。你的任务族能不能在不依赖模型自述的前提下判定对错?如果不能,闭环一定退化为玄学。
第二,区分三个可写面的成本结构。 按 L3 选型:
| 你要改的东西 | 优先载体 | 理由 |
|---|---|---|
| 只在这次任务里有效的临时知识 | Harness(Skill / Tools 槽位) | 改得快,但每次推理都付费 |
| 反复验证有效、要长期用 | Model(有界训练内化) | 一次付费;内化之后**记得把 harness 里对应的冗余知识删掉** |
| 经常变、依赖业务状态 | Harness + 外部数据源 | 权重固化会把易变信息写死 |
第三,给自己的闭环加一条外力任选其一地做冻结核对: 冻结一份评测集、一个 evaluator 版本、一个算力预算上限。三者至少有一个不在修改范围内,你的"提升"才有外部含义。
第四,把服务日志当训练信号来源。 不用等到能跑 RSI:记录"预测的需求档位 → 实际选择的模型档位 → 交互结果"这一条三元组,就已经是 NeoHorse-1 那条闭环的第一公里。它是所有闭环里最便宜的一个入口。
第五,给"我们提升了"加一条内部规矩: 汇报任何自动改进成果时,附一句"这中间有多少是被放大的旧能力,有多少是外部新引入的"(L5)。这句话会让你的复盘质量立刻上一个台阶。
八、我的判断
把所有公开系统按那个五级阶梯排一遍,它们都在 L1 到 L3 之间:
L1 改进执行自主 人类指定改什么、怎么改,AI 执行 ← 今天的工程实践基本在这
L2 改进策略自主 AI 决定 pursue 哪些改进 ← MetaRSI 的两轴调度到了这
L3 经验获取自主 AI 决定下一轮该学什么经验 ← NeoHorse 的能力导向分配接近这
L4 环境适应自主 从部署反馈持续更新 ← 未见公开系统达成
L5 递归元改进 修改<span>"改进机制"</span>本身 ← MetaRSI 的元级策略是弱版本,未见强版本
三个具体判断:
- 路线图 presenting 的两条判据(机制留存 + 增益可归因)应该成为默认审稿标准。 现在把这两条加上,多数"AI 自我改进"的宣称过不了审。这不是泼冷水,是让真正做出递归的工作能被认出来。
- Harness-RSI 是当前性价比最高的一条路,也是最容易被高估的一条。 它不改权重、任何能调 API 的模型都能用——这是它的优点,也是它的天花板:一个基座模型不具备的能力,再好的脚手架也造不出来。singularitymoments 那篇评论的说法很准:它是在给基座模型搭一个更精密的笼子,没有扩大它的推理边界。
- 下一个最值得等的信号,是一个跨 term 的接力实验。 具体说:MetaRSI 报了五个 term 的累计差(+26.2 vs +20.7),但它仍在同一个院子里;真正缺的是"上一个机制的产物,被下一个完全独立的团队 / 完全独立的评测复用之后还能涨"这一项。谁先做出来,谁就把这条判定式从纸面变成了事实。
三个可以立刻自问的问题:
- 我今年加的那些"自动优化",有没有一个 External evaluator 是不在我(或我的系统)的可写范围之内的?
- 我报的那次提升,如果第三方在同一算力预算下用别的方式做,能不能复现这个差值?
- 我的闭环里有哪一项经验,会被下一代无条件继承,而我从没验证过它是对的?第三条是最贵的那一条。
数据来源说明与免责:
- MetaRSI / RSI²:arXiv:2609.06396(9 月);项目页 CosmosMind-ai/RSI-Harness,HuggingFace: CosmosMind/RSI-Harness。所有实验数字均为团队自报,未见第三方复现,"文明级进化引擎"等表述见于团队授权转载渠道,属宣传口径。
- 路线图与 HCI:arXiv:2609.11873(9 月 10 日,33 位作者)。HCI 公式与 393 组观测、五个能力域的具体数值,来自多家第三方技术解读的转述,未经我逐条回溯原论文表格,引用时请按"据报道"处理。
- ModularRSI:arXiv:2609.14857(9 月 14 日),机构为曼彻斯特大学 / IQuest Research / 北航 / M-A-P / 河海大学等;benchmark-disjoint、2000 任务、五模块划分与该 Abstract / PDF 原文一致,具体提升数值未在摘要中给出。代码仓库 github.com/IQuestLab/ModularRSI。
- NeoHorse-1:arXiv:2609.08183(9 月 8 日),11 个基准,4B 58.94→64.87、9B 65.60→69.04 为团队自报。
- Dream-RSI:9 月 14 日,12 页,摘要未给具体 benchmark 数值,仅称"可比或更好的发现质量,同时显著降低发现成本"。
- Princeton shadow evaluation:arXiv 2026 年 8 月 18 日,Peter Kirgis、Sayash Kapoor(Princeton)与英国 AI 安全研究所;3,000、5 小时 vs 计划 36–48 小时、15 轮无 Accept、提前 7 小时完成、0 张图 vs 15 张图等细节转述自 MIT Technology Review 与 the-decoder 的多篇报道。n=2,非盲评,作者在原文中已声明局限性。
- NVIDIA SoL-Pi、Google DeepMind 首席战略官关于 2000 亿美元 capex 押注 RSI 的表述、AlphaEvolve 的 23% kernel / 1% 训练时间 / 0.7% 全球算力等数字,均只见于二手渠道,未经一手确认,仅供背景参考。
把 RSI 从口号拉回可验证框架:判定式、HCI 标尺与三可写面拆解都值得抄进实验协议,适合做 Agent 自进化与评测的研究和工程团队参考。