阶段 8 · 前沿范式

递归自我改进:让 AI 改进 AI
这句话到底说了什么

「让 AI 改进 AI」听起来要么像科幻,要么像营销。这一章把它拆成一件能分级、能查证、也有边界的事: 一根 L1→L5 的自主性尺子,以及它背后真的算出来的那段复利——判断标准只有一条:做决定的那只手是谁的。

1

那个不撒谎的裁判,是人写的

上一章《机械可解释性》的底线是:看不懂一个系统,就别把关键的事交给它。 这一章问它的极限——RLVR 那一章已经演示过:只要有一个不会撒谎的裁判, 模型能自己长出逐步思考能力(这里的「推理」是「一步步想」,不是拿训好的模型跑一遍)——DeepSeek-R1 就是这么长出来的。

但那个裁判是人写的。改什么、什么叫「更好」、什么时候收工,都还是人在定。 模型在这个环里出的力气很多,出的主意很少。 于是有了一个很自然的问题:能不能把人也从环里拿出去?

🎯 类比

让一个实习生改稿子,你和他可以有三档分工:
① 你圈出第三段说「改短点」——他改。(L1)
② 你说「这稿子要更打动人」,他自己决定改哪段、怎么改。(L2 ~ L3)
③ 你说「以后这类稿子你负责」,他连「什么叫好稿子」都自己定了。(L5)

三档都叫「让他改进稿子」,自主性差了好几个量级——「让 AI 改进 AI」之所以不可信,常常是说话的人没说清在讲哪一档。

这个类比管到「谁定好坏」为止:它说的只是自主性怎么分级,不代表模型真会一代比一代强——那是第 3 节的事。

你听到的说法该追问什么
「AI 马上要自己进化了」有实例吗?有判定标准吗?
「我们的模型会自我改进」那条流水线里哪一步是人做的决定?
「自主性阶梯 L1~L5」每一级的判断标准是什么?到哪一级了?

前三行里只有第三行能回答「现在到哪了」。这一章就按这个顺序来:先画尺子(第 2 节),再把数学算一遍(第 3 节),最后标出边界——目前实际系统大多停在 L1~L2,这不是已经实现的东西。

2

一根从 L1 爬到 L5 的自主性尺子

尺子上只有五个刻度。点任意一个刻度(或者直接点下面的级别按钮),会展开那一级: 谁做决定 / 模型的自主动作 / 人类还在做 / 反馈信号 / 现实中到底有没有 / 这一轮的账。

互动 · L1→L5 自主性尺子(点刻度看那一级,带一条「现实标尺」)

一轮改进要多久
—
一年最多几代
—
人的占比
—
人类决策点/轮
—

⚠️ 尺子上那条半透明的色带,是这一章最要紧的一处

它盖在 L1~L2 上:今天能跑的系统都在这个区间里,L3 只有雏形,L4、L5 没有实例。

尺子画到 L5,不代表有人走到了 L5——它是一张地图,不是进度条。

五根柱子里属于人的部分(暖色、上面那截)越往右越少——这是按定义画的,不是测量值。这根尺子能顺带算出一件真事:一轮改进要多久,由两段拼成——

第一段是机器的,第二段是人的。候选数和每候选算力是量级假设,其余数字都真算。 加卡只能压缩第一段:L1 一轮从 8.4 天缩到 1.6 天,再快也降不到 1.5 天以下——那是人做判断花掉的。想更快,只能把人从环里拿出来;每爬一级的代价在下面两节。

3

每一代好一点,n 轮后是多少

这一代的模型,是下一代模型的老师。每一代只比上一代好一点点,好起来的就是复利,不是加法。

💡 整章都藏在这张图里

上一节的尺子管「谁做决定」,这张图管「改进的数学有多大」。拖下面的 v——只要掉到 50%,整条曲线立刻拉平。后面每一节都在解释:这个 v 为什么一级比一级难测出来。

互动 · 复利曲线:真的算一遍 (1 + g·(2v−1))ⁿ

点第 2 节尺子上的级别,会把这个 v 换成那一级的默认值(L1 95% → L5 50%)——自主性越高,你越没法确认这一代是不是真的更好。L4、L5 没人到过,默认 v 是拍的;拖滑块看结论有多敏感。

有效每轮增益
—
翻倍要多少轮
—
按当前级别折算
—
n 轮之后是几倍
—

名义上每轮涨 g,但只有 v 那部分是真的更好,剩下其实是悄悄改坏。 所以 v = 100% 时净增益 +g;v = 50% 时两者正好抵消,净增益归零:

可信度 v有效每轮增益这条曲线会怎么走
100%+g全额拿到复利
75%+0.5 g还是涨,只剩一半速度
50%0水平线——一半是真的,等于原地踏步
25%−0.5 g往下走:越改越差,差得也是复利

如果真到了 L5,改进速度就不再踩在人的速度上。但这是「如果」,不是「已经」。这一章在 L5 把 v 设成 50%,不是测量值是占位——正好落在原地踏步线上。所以曲线上那个天文数字叫「假设」不叫「预测」:把 n 从 20 拖到 120,看它从 ×27 涨到 4.2×10^8——那是敏感性分析。

4

已经发生的六个真实例子

下面六个系统都是真的、都能查到,大多在 L1~L2,最后一个已经在 L3 门口。

一个真实的 L1 循环:五步里两步是人,而且是最慢的两步

这六个系统,各自落在尺子的哪一段

「已达 L1」= 模型能自己跑完,人只定方向;「部分到 L2」= 它还能自己挑方法;最后一个到了 L3 门口,但裁判也归它自己。

真实系统它改的是什么谁在做决定一个具体数字
NAS(架构搜索) 模型的结构(几层、怎么连) 人画搜索空间和指标,模型搜 800 块 GPU 并行搜索,只为一个 CIFAR-10(10 类小图片)的结构
芯片布局(AlphaChip 一类) 训练 AI 的加速器本身 人定目标,模型提布局 布局被用进了好几代 TPU
用模型筛训练数据
(FineWeb-Edu 一类)
「学什么」里的数据那一半 人定「教育价值」,模型当筛子 筛过的语料打赢 token 多好几倍的没筛语料
RLVR(DeepSeek-R1 那条线) 推理行为 人写规则裁判,模型自己长出长链 没人教它「一步步想」
AI 写算法和 kernel
(GPU 上的底层算子)
训模型、跑的代码 人定评测器,模型写候选自筛 48 次乘法算 4×4 复矩阵(元素是复数),比 Strassen 1969 年那个快速算法的 49 次少 1 次
AI 跑自己的研究(AI Scientist 一类) 研究流程本身 模型从提想法到写论文 「论文好不好」也是它自己评的
💡 把这六行横过来看,会看到同一件东西

每一行都藏着一个裁判:测试套件、仿真器、验证器、编译跑分、下游评测集——全是人造的,没有一个是候选池里的选手。L1~L2 能成立,秘密就在这。

5

不是算力不够,是「量不出来」

从 L1 爬到 L5,「这一代真的更好了吗」越难答。先把五级的裁判排开:

级别谁来判「更好」一次验证要多久这个信号有多硬
L1测试套件 / 编译器 / loss秒 ~ 小时 硬:对错是客观的
L2人挑的指标小时 ~ 天 硬,但方向是人挑的,挑错就跑偏
L3下游多任务评测天 ~ 周 开始软:评测有噪声,还能被模型猜出想要什么
L4真实用户的行为周 ~ 月 很软:慢、有偏,你换策略用户也变
L5模型自己没有 没有尺子:连「什么叫更好」它自己定

把「硬不硬」变成一个数字:判断「这一代真的更好」是一次统计检验,要把「真的变好了」和「随机波动」分开。最家常的近似式是 需要的评测次数 ≈ 16 × (σ / d)²:σ 是评测分数的波动,d 是要分辨的差距; 16 ≈ 2 × (1.96 + 0.84)²(80% 把握、5% 显著性的单组样本量,比两个系统再翻倍)。d 越小、σ 越大,样本数按平方涨(d/σ 是假设,平方是真的)。

要多少次评测,才能有把握说「这一代真的更好了」

条长 = 1 + log₁₀(次数),所以 17,444 次只比 1,570 次长一点。

差距越小,要的评测次数按平方涨

一个实验室一年跑得起几百次实验。L1 跑一遍测试就够;L4 要上千次评测——一年也跑不完一轮。瓶颈不是算力,是「更好」在高等级上无法被廉价地测量,这也是第 3 节 v 只能是假设的原因。

🎯 信号弱的时候,连当事人都分不清

2025 年 METR(一个测 AI 实际生产力的机构)让有经验的程序员做自己仓库里的真实任务,一半用 AI、一半不用。结果——用 AI 的那组实际慢 19%,自己却觉得快 20%。

6

这个家族按「改进什么」排一遍

递归自我改进的家族是一张「改什么」的清单:改的东西越靠下,判断标准越难写。

改的东西越靠下,判「更好」的那把尺子越不硬

改进的对象谁在判「更好」现在到哪最要命的地方
超参数验证集 lossL1便宜,但收益早被榨干
数据配比下游多任务评测L1分高的数据 ≠ 更有用的数据
模型结构(NAS)重训后的指标已达 L1,部分 L2搜一次就是几百块 GPU × 几周
推理行为(RLVR)程序裁判(可验证奖励 + 强化学习)L1只对客观对错的任务有效
代码与 kernel编译器 + 跑分已达 L1,部分 L2离「AI 改 AI」最近
提示与工作流任务成功率L1自评不可靠,成功率太粗
数据生成训完再评L2自己造的数据会放大自己的偏差
评测标准本身???L3裁判和选手开始合谋
递归元改进(元 = 关于改进本身的改进)???L5没有判定标准,所以也没有实例

表里那两个「???」不是留白,它们就是这一章的中心:越往上爬,判断好坏的尺子越可能是模型自己手里那把。一旦尺子在选手手里,「这一代更好了」就不再可检验,只成一句自我评价。

M

数学 · 一半是真的就原地踏步

第 3 节那条曲线只写了一行公式,里面却藏着一个最反直觉的数: 可信度 v 掉到一半,曲线就平了——不是掉到 0 才平。 为什么偏偏是一半?下面这张图把「一轮改进」真的算一遍。

互动 · 一轮改进:真的涨的,减掉白折腾的

真的变好的部分
—
白折腾的部分
—
这一轮的净收益
—
n 轮之后是几倍
—

上面那一行是活的:v、g、n 都跟着滑块变,C 是算出来的结果。把 v 拖到 0.50,看括号里剩下什么——正好是 1,几次方都还是 1。

🎯 一筐苹果,理解这一轮

每轮改 100 个地方,名义上都涨 g。但裁判不够硬,只有 v 那部分真的涨了,剩下 1−v 其实悄悄改坏了。

真的涨的 g·v 往上顶,白折腾的 g·(1−v) 往下拉,两者之差 = 净收益 g·(2v−1):v = 一半时两根箭头一样长,净收益归零。

🎬 自己验一遍

把 v 从 100% 慢慢往下拉:它不需要掉到 0 才停——掉到 50% 那一格,右边那条曲线就变成一条水平线; 再往下,第 8 代的能力就开始比今天还低。然后把 v 拖回 50% 以上,看那根线怎么重新抬头。

7

什么时候不该让它自己改

前面几节都是能力账,这一节是代价账。五件事,每一件都在真实系统里出现过。

你想要的你付出的什么时候真的会痛 → 换什么
更快的迭代 研究议程被评测器绑架:为了能快速验证,你会只挑「容易快速验证的东西」,打不了分的(长期价值、体验)越来越少 只做能自动打分的问题 → 留一部分给人
更高的分数 Goodhart 定律:指标一旦成为目标就不再是好指标——模型优化的是你写下的尺子,不是你心里的「更好」 指标涨用户没感觉 → 盯个外部指标
更大的自主性 多样性坍缩:自己造数据、自己筛,偏差被一代代放大,像近亲繁殖——短期越「纯」,长期越脆 生成数据有系统偏差 → 混入真人数据
持续在线学习(L4) 漂移与遗忘:「边用边学」撞在灾难性遗忘那章上,学新的会忘旧的,在线分布还在变 行为一天天飘 → 只在能回滚时开
不用人盯着 责任真空:出事了谁签字?(接对齐、安全与越狱那一章) 出事没人能解释 → 保留人类签字点
⚠️ 一句话写清边界

今天所有「自我改进」的实例,几乎都是在一个固定的、人造的、可验证的裁判里面转圈;裁判不变,天花板就是那个裁判的天花板。

想往上爬一级,要做的不是加算力,是造一个更好的裁判——而「什么叫更好的裁判」里藏着循环:那一级的判断标准,又是谁来写的?这就是为什么这件事在评测和制度上花的力气比算法多。

所以真正要回答的只有一个问题:我要买的是速度,还是可验证性?两个都要,就先别上 L3。

8

小结

这一章真正要记住的,是一根尺子和一个数字。

一件事只有三种结局:裁判在人手里、在模型手里、或者没有

它对应哪条线 全书主线之一:② 没有免费午餐 → 必须有归纳偏置——自主性不是白来的:每上一级都要一份更强的外部信号,能构造、能快速测、还不容易被钻空子。
一句话 递归自我改进,就是把「改进」从人手里搬进模型手里;能搬多远,取决于谁能不撒谎地说出「这次真的更好了」。
它牺牲了什么 越往上爬,判断好坏的镜子越可能是模型自己造的:不是「能力不够所以慢」,是越自主越说不清自己有没有变好。(回扣暗线 B)

它在暗线里站在哪

暗线这一章的回答
B 什么被牺牲了 可验证性和多样性。为了能自动判对错,会缩小到「能被验证的问题」;为了自己造训练信号,会用自己的偏差喂自己——危险的不是往下走,是你以为在往上走。
C 参数账本 一轮改进 = M 个候选 × 每个候选一整次训练。10 亿参数 × 200 亿 token 跑一遍约 333 GPU·小时;最贵的是跑 M 个候选并各拿到可信分数。
F 违背了哪个直觉 直觉是「自主性越高、改进越快」。真去算:自主性越高,越没法确认改进是不是真的——「更快」在数学上成立,在认识论上不成立。

它接住上一章《机械可解释性》的底线,也算过《硬件与算力账本》和《RLVR 与 GRPO》那笔账;剩下的问题「裁判的裁判,又是谁」,下一章《世界模型与具身智能》收尾。

一句话带走递归自我改进

RSI 不是「AI 要自己进化了」,是一根五级自主性尺子(L1 人指定怎么改 → L2 选方法 → L3 决定学什么 → L4 真实部署里改进 → L5 改「自己改进的机制」),判断标准只有一条:做决定的那只手是谁的。 实际系统大多停在 L1~L2,卡点是「这一代真的更好了吗」越来越测不出来(第 5 节那条 (σ/d)²)。所以呢:下次听到「自我改进」,只问——它的裁判是谁写的?

9

拓展阅读

上面讲的都是「够用」的版本。想往下挖,这里有三个入口—— 它们不是必修内容,是给想再往前走一步的读者准备的。

📄 这一章的说法从哪来

💻 工业界怎么写

∑ 更严格的形式