「让 AI 改进 AI」听起来要么像科幻,要么像营销。这一章把它拆成一件能分级、能查证、也有边界的事: 一根 L1→L5 的自主性尺子,以及它背后真的算出来的那段复利——判断标准只有一条:做决定的那只手是谁的。
上一章《机械可解释性》的底线是:看不懂一个系统,就别把关键的事交给它。 这一章问它的极限——RLVR 那一章已经演示过:只要有一个不会撒谎的裁判, 模型能自己长出逐步思考能力(这里的「推理」是「一步步想」,不是拿训好的模型跑一遍)——DeepSeek-R1 就是这么长出来的。
但那个裁判是人写的。改什么、什么叫「更好」、什么时候收工,都还是人在定。 模型在这个环里出的力气很多,出的主意很少。 于是有了一个很自然的问题:能不能把人也从环里拿出去?
让一个实习生改稿子,你和他可以有三档分工:
① 你圈出第三段说「改短点」——他改。(L1)
② 你说「这稿子要更打动人」,他自己决定改哪段、怎么改。(L2 ~ L3)
③ 你说「以后这类稿子你负责」,他连「什么叫好稿子」都自己定了。(L5)
三档都叫「让他改进稿子」,自主性差了好几个量级——「让 AI 改进 AI」之所以不可信,常常是说话的人没说清在讲哪一档。
这个类比管到「谁定好坏」为止:它说的只是自主性怎么分级,不代表模型真会一代比一代强——那是第 3 节的事。
| 你听到的说法 | 该追问什么 |
|---|---|
| 「AI 马上要自己进化了」 | 有实例吗?有判定标准吗? |
| 「我们的模型会自我改进」 | 那条流水线里哪一步是人做的决定? |
| 「自主性阶梯 L1~L5」 | 每一级的判断标准是什么?到哪一级了? |
前三行里只有第三行能回答「现在到哪了」。这一章就按这个顺序来:先画尺子(第 2 节),再把数学算一遍(第 3 节),最后标出边界——目前实际系统大多停在 L1~L2,这不是已经实现的东西。
尺子上只有五个刻度。点任意一个刻度(或者直接点下面的级别按钮),会展开那一级: 谁做决定 / 模型的自主动作 / 人类还在做 / 反馈信号 / 现实中到底有没有 / 这一轮的账。
互动 · L1→L5 自主性尺子(点刻度看那一级,带一条「现实标尺」)
它盖在 L1~L2 上:今天能跑的系统都在这个区间里,L3 只有雏形,L4、L5 没有实例。
尺子画到 L5,不代表有人走到了 L5——它是一张地图,不是进度条。
五根柱子里属于人的部分(暖色、上面那截)越往右越少——这是按定义画的,不是测量值。这根尺子能顺带算出一件真事:一轮改进要多久,由两段拼成——
第一段是机器的,第二段是人的。候选数和每候选算力是量级假设,其余数字都真算。 加卡只能压缩第一段:L1 一轮从 8.4 天缩到 1.6 天,再快也降不到 1.5 天以下——那是人做判断花掉的。想更快,只能把人从环里拿出来;每爬一级的代价在下面两节。
这一代的模型,是下一代模型的老师。每一代只比上一代好一点点,好起来的就是复利,不是加法。
上一节的尺子管「谁做决定」,这张图管「改进的数学有多大」。拖下面的 v——只要掉到 50%,整条曲线立刻拉平。后面每一节都在解释:这个 v 为什么一级比一级难测出来。
互动 · 复利曲线:真的算一遍 (1 + g·(2v−1))ⁿ
点第 2 节尺子上的级别,会把这个 v 换成那一级的默认值(L1 95% → L5 50%)——自主性越高,你越没法确认这一代是不是真的更好。L4、L5 没人到过,默认 v 是拍的;拖滑块看结论有多敏感。
名义上每轮涨 g,但只有 v 那部分是真的更好,剩下其实是悄悄改坏。
所以 v = 100% 时净增益 +g;v = 50% 时两者正好抵消,净增益归零:
| 可信度 v | 有效每轮增益 | 这条曲线会怎么走 |
|---|---|---|
| 100% | +g | 全额拿到复利 |
| 75% | +0.5 g | 还是涨,只剩一半速度 |
| 50% | 0 | 水平线——一半是真的,等于原地踏步 |
| 25% | −0.5 g | 往下走:越改越差,差得也是复利 |
如果真到了 L5,改进速度就不再踩在人的速度上。但这是「如果」,不是「已经」。这一章在 L5 把 v 设成 50%,不是测量值是占位——正好落在原地踏步线上。所以曲线上那个天文数字叫「假设」不叫「预测」:把 n 从 20 拖到 120,看它从 ×27 涨到 4.2×10^8——那是敏感性分析。
下面六个系统都是真的、都能查到,大多在 L1~L2,最后一个已经在 L3 门口。
一个真实的 L1 循环:五步里两步是人,而且是最慢的两步
这六个系统,各自落在尺子的哪一段
「已达 L1」= 模型能自己跑完,人只定方向;「部分到 L2」= 它还能自己挑方法;最后一个到了 L3 门口,但裁判也归它自己。
| 真实系统 | 它改的是什么 | 谁在做决定 | 一个具体数字 |
|---|---|---|---|
| NAS(架构搜索) | 模型的结构(几层、怎么连) | 人画搜索空间和指标,模型搜 | 800 块 GPU 并行搜索,只为一个 CIFAR-10(10 类小图片)的结构 |
| 芯片布局(AlphaChip 一类) | 训练 AI 的加速器本身 | 人定目标,模型提布局 | 布局被用进了好几代 TPU |
| 用模型筛训练数据 (FineWeb-Edu 一类) |
「学什么」里的数据那一半 | 人定「教育价值」,模型当筛子 | 筛过的语料打赢 token 多好几倍的没筛语料 |
| RLVR(DeepSeek-R1 那条线) | 推理行为 | 人写规则裁判,模型自己长出长链 | 没人教它「一步步想」 |
| AI 写算法和 kernel (GPU 上的底层算子) |
训模型、跑的代码 | 人定评测器,模型写候选自筛 | 48 次乘法算 4×4 复矩阵(元素是复数),比 Strassen 1969 年那个快速算法的 49 次少 1 次 |
| AI 跑自己的研究(AI Scientist 一类) | 研究流程本身 | 模型从提想法到写论文 | 「论文好不好」也是它自己评的 |
每一行都藏着一个裁判:测试套件、仿真器、验证器、编译跑分、下游评测集——全是人造的,没有一个是候选池里的选手。L1~L2 能成立,秘密就在这。
从 L1 爬到 L5,「这一代真的更好了吗」越难答。先把五级的裁判排开:
| 级别 | 谁来判「更好」 | 一次验证要多久 | 这个信号有多硬 |
|---|---|---|---|
| L1 | 测试套件 / 编译器 / loss | 秒 ~ 小时 | 硬:对错是客观的 |
| L2 | 人挑的指标 | 小时 ~ 天 | 硬,但方向是人挑的,挑错就跑偏 |
| L3 | 下游多任务评测 | 天 ~ 周 | 开始软:评测有噪声,还能被模型猜出想要什么 |
| L4 | 真实用户的行为 | 周 ~ 月 | 很软:慢、有偏,你换策略用户也变 |
| L5 | 模型自己 | 没有 | 没有尺子:连「什么叫更好」它自己定 |
把「硬不硬」变成一个数字:判断「这一代真的更好」是一次统计检验,要把「真的变好了」和「随机波动」分开。最家常的近似式是
需要的评测次数 ≈ 16 × (σ / d)²:σ 是评测分数的波动,d 是要分辨的差距;
16 ≈ 2 × (1.96 + 0.84)²(80% 把握、5% 显著性的单组样本量,比两个系统再翻倍)。d 越小、σ 越大,样本数按平方涨(d/σ 是假设,平方是真的)。
要多少次评测,才能有把握说「这一代真的更好了」
条长 = 1 + log₁₀(次数),所以 17,444 次只比 1,570 次长一点。
差距越小,要的评测次数按平方涨
一个实验室一年跑得起几百次实验。L1 跑一遍测试就够;L4 要上千次评测——一年也跑不完一轮。瓶颈不是算力,是「更好」在高等级上无法被廉价地测量,这也是第 3 节 v 只能是假设的原因。
2025 年 METR(一个测 AI 实际生产力的机构)让有经验的程序员做自己仓库里的真实任务,一半用 AI、一半不用。结果——用 AI 的那组实际慢 19%,自己却觉得快 20%。
递归自我改进的家族是一张「改什么」的清单:改的东西越靠下,判断标准越难写。
改的东西越靠下,判「更好」的那把尺子越不硬
| 改进的对象 | 谁在判「更好」 | 现在到哪 | 最要命的地方 |
|---|---|---|---|
| 验证集 loss | L1 | 便宜,但收益早被榨干 | |
| 数据配比 | 下游多任务评测 | L1 | 分高的数据 ≠ 更有用的数据 |
| 模型结构(NAS) | 重训后的指标 | 已达 L1,部分 L2 | 搜一次就是几百块 GPU × 几周 |
| 推理行为(RLVR) | 程序裁判(可验证奖励 + | L1 | 只对客观对错的任务有效 |
| 代码与 kernel | 编译器 + 跑分 | 已达 L1,部分 L2 | 离「AI 改 AI」最近 |
| 提示与工作流 | 任务成功率 | L1 | 自评不可靠,成功率太粗 |
| 数据生成 | 训完再评 | L2 | 自己造的数据会放大自己的偏差 |
| 评测标准本身 | ??? | L3 | 裁判和选手开始合谋 |
| 递归元改进(元 = 关于改进本身的改进) | ??? | L5 | 没有判定标准,所以也没有实例 |
表里那两个「???」不是留白,它们就是这一章的中心:越往上爬,判断好坏的尺子越可能是模型自己手里那把。一旦尺子在选手手里,「这一代更好了」就不再可检验,只成一句自我评价。
第 3 节那条曲线只写了一行公式,里面却藏着一个最反直觉的数:
可信度 v 掉到一半,曲线就平了——不是掉到 0 才平。
为什么偏偏是一半?下面这张图把「一轮改进」真的算一遍。
互动 · 一轮改进:真的涨的,减掉白折腾的
上面那一行是活的:v、g、n 都跟着滑块变,C 是算出来的结果。把 v 拖到 0.50,看括号里剩下什么——正好是 1,几次方都还是 1。
每轮改 100 个地方,名义上都涨 g。但裁判不够硬,只有 v 那部分真的涨了,剩下 1−v 其实悄悄改坏了。
真的涨的 g·v 往上顶,白折腾的 g·(1−v) 往下拉,两者之差 = 净收益 g·(2v−1):v = 一半时两根箭头一样长,净收益归零。
把 v 从 100% 慢慢往下拉:它不需要掉到 0 才停——掉到 50% 那一格,右边那条曲线就变成一条水平线; 再往下,第 8 代的能力就开始比今天还低。然后把 v 拖回 50% 以上,看那根线怎么重新抬头。
前面几节都是能力账,这一节是代价账。五件事,每一件都在真实系统里出现过。
| 你想要的 | 你付出的 | 什么时候真的会痛 → 换什么 |
|---|---|---|
| 更快的迭代 | 研究议程被评测器绑架:为了能快速验证,你会只挑「容易快速验证的东西」,打不了分的(长期价值、体验)越来越少 | 只做能自动打分的问题 → 留一部分给人 |
| 更高的分数 | Goodhart 定律:指标一旦成为目标就不再是好指标——模型优化的是你写下的尺子,不是你心里的「更好」 | 指标涨用户没感觉 → 盯个外部指标 |
| 更大的自主性 | 多样性坍缩:自己造数据、自己筛,偏差被一代代放大,像近亲繁殖——短期越「纯」,长期越脆 | 生成数据有系统偏差 → 混入真人数据 |
| 持续在线学习(L4) | 漂移与遗忘:「边用边学」撞在灾难性遗忘那章上,学新的会忘旧的,在线分布还在变 | 行为一天天飘 → 只在能回滚时开 |
| 不用人盯着 | 责任真空:出事了谁签字?(接对齐、安全与越狱那一章) | 出事没人能解释 → 保留人类签字点 |
今天所有「自我改进」的实例,几乎都是在一个固定的、人造的、可验证的裁判里面转圈;裁判不变,天花板就是那个裁判的天花板。
想往上爬一级,要做的不是加算力,是造一个更好的裁判——而「什么叫更好的裁判」里藏着循环:那一级的判断标准,又是谁来写的?这就是为什么这件事在评测和制度上花的力气比算法多。
所以真正要回答的只有一个问题:我要买的是速度,还是可验证性?两个都要,就先别上 L3。
这一章真正要记住的,是一根尺子和一个数字。
一件事只有三种结局:裁判在人手里、在模型手里、或者没有
| 暗线 | 这一章的回答 |
|---|---|
| B 什么被牺牲了 | 可验证性和多样性。为了能自动判对错,会缩小到「能被验证的问题」;为了自己造训练信号,会用自己的偏差喂自己——危险的不是往下走,是你以为在往上走。 |
| C 参数账本 | 一轮改进 = M 个候选 × 每个候选一整次训练。10 亿参数 × 200 亿 token 跑一遍约 333 GPU·小时;最贵的是跑 M 个候选并各拿到可信分数。 |
| F 违背了哪个直觉 | 直觉是「自主性越高、改进越快」。真去算:自主性越高,越没法确认改进是不是真的——「更快」在数学上成立,在认识论上不成立。 |
它接住上一章《机械可解释性》的底线,也算过《硬件与算力账本》和《RLVR 与 GRPO》那笔账;剩下的问题「裁判的裁判,又是谁」,下一章《世界模型与具身智能》收尾。
RSI 不是「AI 要自己进化了」,是一根五级自主性尺子(L1 人指定怎么改 → L2 选方法 → L3 决定学什么 → L4 真实部署里改进 → L5 改「自己改进的机制」),判断标准只有一条:做决定的那只手是谁的。
实际系统大多停在 L1~L2,卡点是「这一代真的更好了吗」越来越测不出来(第 5 节那条 (σ/d)²)。所以呢:下次听到「自我改进」,只问——它的裁判是谁写的?
上面讲的都是「够用」的版本。想往下挖,这里有三个入口—— 它们不是必修内容,是给想再往前走一步的读者准备的。