上一章《递归自我改进》讲的是 AI 改自己;这一章往外走一步,
有了世界模型,机器人不必真撞一百次墙才学会一件事:它可以在想象里撞。
这也是全课的最后一章。所以它还要回答读到这儿必然会冒出来的那个问题:
这些东西加起来,到底能做成什么?
模型不再只是「答得对不对」,它要真的动手做事, 于是会撞上两个绕不开的问题:试错太贵,而且语言模型没有身体。
先看第一个问题。在真实世界里失败一次,代价可能是撞坏机械臂、翻车,甚至伤人,
所以「让它多试几次就会了」这条最省事的路,一开始就走不通。
而把试错交给机器,就是
| 试错方式 | 一次尝试的成本 | 能试多少次 |
|---|---|---|
| 在真实世界试 | 一次失败的代价可能是撞坏机械臂、翻车,甚至伤人 | 几百次就顶天了 |
| 在物理仿真里试 | 便宜,但仿真器和真实世界的物理参数总是不一样 | 几百万次 |
| 在 |
就是一次前向计算。而且模型是从真实数据里学出来的,比手写物理引擎更贴近真实 | 想要多少次就有多少次 |
互动 · 同样的预算,三条路各能试多少次
你搬新家,要把一张沙发塞进客厅。你会怎么做?
不会真的把沙发抬起来试二十遍——你会先在脑子里过一遍:「先横过来、走到门口要侧一下、沙发脚可能会卡住……」
那个「在脑子里过一遍」的过程,用的就是你的
这个类比管到「先在脑子里过一遍」为止:你的大脑是练了很多年才准的;
模型的世界是从数据里现学的,数据没覆盖到的地方,它照样很自信。
顺着这个类比,
第二个问题:就算试错不要钱,模型也未必会动手。 它能把「杯子掉下去会碎」讲得头头是道,还能列一段防止杯子掉落的注意事项。 但那两件事都不是物理常识:那是关于物理的句子,不是关于物理的手感。 杯子放在桌边、杯身已经有一半悬空时,最要紧的不是「它会不会碎」, 而是「我该先退后半步,还是先伸手扶住」。这个决定,它给不出来。
| 比什么 | 语言模型知道 | 具身智能必须知道 |
|---|---|---|
| 知识形态 | 陈述性:「是这样」——所有句子的统计规律 | 程序性:「该这么做」——一串带顺序的动作 |
| 出错的样子 | 说错一句,重说一遍就行 | 夹错位置,东西就碎了。没有「撤回」 |
| 怎么得到 | 读遍互联网上的文字 | 必须在真实世界里动过手,才能拿到反馈 |
| 时间尺度 | 可以想三分钟再答 | 必须在几十毫秒内给出下一步 |
互动 · 时间尺度:一边可以想三分钟,一边只有几十毫秒
想象不是越深越好。这句话和直觉反着来,所以先把它做成一个旋钮: 拖「想象深度」,看右边那条 真实 的误差曲线先往下、再掉头往上。 那个深度就是转移函数 f 被套在自己身上的次数:给出当前状态和动作,f 预测下一个状态 (它是拿大量「状态、动作、下一状态」的数据监督训出来的)。 谷底两边各夹着一种失败:推得太浅够不到目标,推得太深就被误差带偏;误差为什么会长成那样,第 4 节再拆。
互动 · 想象深度 vs 真实收益(真的跑动力学、真的搜索增益)
左 · 当前深度下的两条轨迹:蓝虚线 = 想象, 粉实线 = 真实
蓝虚线是模型以为的自己。推演得越深,它就越有把握——误差稳稳地往 0 掉, 因为它一直在自己的世界里推自己,没有一条外部信息进来纠正它。
粉实线是真实世界。它先往下走(推得太浅确实够不到目标), 到一个最低点之后掉头往上:推演得越深,真实结果反而越差。
两条线之间越张越开的那道口子,就是这一章最想让你记住的东西—— 想象得越久,它离现实越远,而它自己毫无察觉。
操作:先找到那条真实误差曲线的最低点(上面那行读数会告诉你谷底在第几步),再往右拖几格,看它涨回去多少。 为什么会上涨?深度一长,模型在长链条上攒下的偏差就足够大: 拿世界模型做规划的那个模块,会非常自信地挑出一条在自己世界里完美、在真实世界里更差的动作。 深度越深,它越自信,也就错得越离谱。
所以「想得久一点总没错」是错的。想象的价值有一个上限, 而上限由「模型和现实隔多远」决定,不由你能算多久决定。
| 路线 | 预测什么 | 代表 | 特点 |
|---|---|---|---|
| ① 视频预测 | 直接预测未来的像素 | Sora、Genie、Cosmos | 直观、通用,能利用海量互联网视频。 但算力极贵,而且很容易把「看起来对」和「物理上对」混淆 |
| ② 潜空间模拟 | 先压成抽象表示,在潜空间里预测未来(JEPA 连像素都不还原) | Dreamer v1-v3、JEPA | 高效、稳定,真正用来训练智能体的那一类。 Dreamer 在 DeepMind Control 的 20 个连续控制任务上,只靠想象就把策略训了出来 |
| ③ 显式物理 / 3D | 建模几何与物理规律本身(NeRF、3D 高斯泼溅:把场景存成可渲染的 3D 表示) | NeRF、3D 高斯泼溅、可微物理引擎 | 可解释、可控,能保证一定的物理一致性。 难以泛化到没见过的场景 |
互动 · 一个「状态」要用多少个数字表示
「
这是所有
互动 · 多步预测的误差累积(真实迭代计算)
金色 = 真实轨迹 绿色 = 模型预测
如果误差是线性增长的,那预测多远都还能接受:误差除以步数是个常数。 但你看它长得更快。每一步的输入都是上一步的输出, 所以上一步的误差会变成这一步的输入偏置,然后继续放大。 这就是复合误差(compounding error):单步误差不是相加,而是相乘。 「相乘」的那笔账,在后面「数学 · 误差为什么是相乘长大的」一节里算。
看误差曲线怎么被压回低位。
这是真实系统的标准做法:没人指望
世界模型的价值不在「一次看得很远」,而在「每次都能快速试错」。
这一节是一幅左右对照的双联画:左边在脑子里试,右边真做一遍。
任务很小:把一个质点从原点推到目标点。控制方式是一个比例控制器
a = k · (目标 − 位置),唯一的旋钮是增益 k(增益越大,动作越猛)。
两边跑的是同一个式子,只有 f 不一样:左边那套是模型以为的(增益偏弱、摩擦偏大),
右边那套是真实的。
互动 · 想象-行动双联画(真的跑动力学、真的搜索增益)
左 · 想象:只算,不执行
右 · 实际:真的执行
机器人怎么挑那个增益 k?它把 40 个候选增益各推演一遍,挑出自己以为终点离目标最近的那个。 在想象里跑这 40 条,只花算力(默认 40 条 × 5 步 = 200 次前向),几乎不要钱; 同样这 40 条要在真实世界里跑完,就是 200 步真实执行,机械臂会磨损、杯子会摔碎。 切到「只用实际」看看纯试错要花多少真实步数:同样的挑选,代价差几十倍。
把「模型与真实世界的偏差」往右拉,两幅画布上的轨迹会开始分叉。这就是 sim2real 鸿沟(sim = 仿真,real = 真实:两边规律对不上的那截差): 仿真里的摩擦力、质量、延迟永远和真实有出入,而且这个出入不是随机的,是系统性的, 所以不能靠多试几次平均掉。偏差甚至可能是反的:有些设定下模型会低估自己,真实结果反而更好。 重要的不是偏向哪边,而是你在想象里看不到这个偏差。
互动 · 偏差是系统性的:试再多次也平均不掉
「推演」这个词听着玄,其实只有一句话:把同一个 f,一步接一步地套下去。 下面这张图会一步一步算给你看:每一步都拿上一步的结果,再问 f 同一个问题。
动画 · 推演一遍:每一步都在问 f 同一个问题
微型图解 · 这一步的两个箭头
上面那笔账只看了「推演一次」。把它放大成一个完整的任务: 把一个质点从起点推到目标点,中间挡着一个障碍物。 两种策略比的是消耗多少「真实环境」的步数。 每个方法都跑 5 个随机种子取平均:随机实验只跑一次就下结论,那是在挑数据。
互动 · 无模型试错 vs 有模型规划
纯试错:没有模型可问,只能挑一条动作序列在真实环境里跑完,看结果好不好,每一条都要付出真实代价。
有模型(MPC,Model Predictive Control:在模型里试几条,挑最好的执行,再重来):先在
这一节的图上有三个旋钮。第二个是模型对障碍的认知程度,它模拟 sim2real 鸿沟: 真实世界有这个障碍,但模型可能根本不知道它存在。 第三个是规划视距,一次规划多少步再重新决策,它决定了「你有多信任世界模型」。
互动 · 为了在真实世界走一步,要花多少次模型前向
把下面那张表画出来 · 视距越短,模型缺的那块知识越贵
先记住这个反直觉的实测结果。让模型不知道障碍物,只改规划视距(5 个随机种子取平均):
| 规划视距 | 模型不知道障碍 | 模型知道障碍 | 差距 |
|---|---|---|---|
| 4 步 | 205 步 | 48 步 | 4.3 倍 |
| 8 步 | 155 步 | 65 步 | 2.4 倍 |
| 16 步 | 116 步 | 76 步 | 1.5 倍 |
| 32 步 | 110 步 | 119 步 | 基本持平 |
上面比的是同一个任务里的步数。把尺度再放大:达到同一个熟练度,各自要多少次真实尝试。 (遥操作:人用手柄或动捕设备遥控机器人做事,把轨迹录下来当示范。)
同一种技能,要付多少「真实尝试」
条形长度画的是数量级的对数——否则左边那条会是 0 像素宽。 数字是量级估计,不是精确值。
互动 · 纯试错 vs 用
一个孩子看大人倒水几次,就学会了「杯子别倒太满」。
机器人要学会同一件事,可能要几千次真实尝试,每次都得真倒一杯水,
洒了还得有人来擦。
这就是具身智能最大的瓶颈:不是模型不够聪明,是「试」太贵。
世界模型回答「接下来会怎样」,可机器人要的是「我现在该做什么」。
近几年(从 RT-2 起),这个方向的主流做法叫 VLA(Vision-Language-Action):
视觉看懂场景 + 语言理解指令 + 直接输出动作。
它其实就是把
VLA 的数据流:输出层换成了动作
注意最后那个框:它一次吐出的不是一个动作,而是一段动作。 这段有多长各论文不同(ACT 约 100 步、π0 约 50 步),下面按 16 步算一段; 这叫动作分块(action chunking),理由是:每步都重新决策,机器人会抖, 就像你写字时不会每一笔都重新考虑握笔姿势。
互动 · 每步都重新决策,手会抖成什么样
| 动作怎么吐出来 | 怎么做 | 代价 |
|---|---|---|
| ① 直接回归 | 动作头就是一个全连接层,直接输出数值 | 容易输出「所有动作的平均」——两个都对的方案平均起来往往都不对 |
| ② 离散成 token | 把每个动作维度切成若干格,当成词表,用预测下一个 token 的方式生成 | 能直接复用语言模型的整套训练方法。分辨率被切格数限制 |
| ③ 扩散 / |
把「一整段动作」当成一张要生成的图,用去噪或直线路径把它生成出来 | 能表达「有好几种都行」的动作分布,是现在开源 VLA 的主流(π0,Physical Intelligence 的机器人模型)。推理要多走几步去噪 |
互动 · 两种做法都对,取平均却两边都不是
互动 · 切成格子(做法 ②):省事,但精度被格数封顶
这条路线的核心想法,是把「动作」当成另一种语言:
既然 Transformer 能学「文字到文字」,它也能学「图 + 字 → 动作」,
只要把动作这一侧的表示问题解决好。这条路线能成,几乎全是
| 难点 | 为什么难 |
|---|---|
| 动作是连续的 | 语言模型输出的是「从几万个词里选一个」。机器人的动作是
6 个关节角度、每个都是浮点数——没法用 softmax 输出。
常见解法有三条:动作分块(各论文不同,ACT 约 100 步、π0 约 50 步)、扩散/ |
| 动作有后果 | 语言模型说错一句话,重说一遍就行。机器人夹错位置,可能把东西打碎。 容错率完全不同 |
| 没有互联网规模的机器人数据 | 文本和图像有几十亿的语料。真实机器人操作数据呢?公开的最大数据集之一 DROID 也只有 7.6 万条轨迹、350 小时。 这是具身智能最大的瓶颈 |
| 时间是一致的 | 语言可以来回修改,动作必须沿着时间轴往前推进,而且要在毫秒级做出反应 |
互动 · 连续动作怎么变成「能 softmax 的东西」
① 遥操作采集——人穿着动捕设备或用手柄遥控机器人干活,把轨迹录下来。
质量最高,但人力极贵。
② 仿真合成——在物理引擎里生成海量轨迹。便宜,但存在 sim2real 鸿沟。
③ 从人类视频学习——网上有海量的做饭、修理、组装视频。
但视频里没有动作标签——你能看到手在切菜,但不知道关节力矩是多少。
这个「从观察到动作」的鸿沟是当前最活跃的研究方向之一。
VLA 是反应式的:看到这个,就做那个。它快,但它没有「如果……会怎样」这一层。 2026 年 5 月的一个新提法把这一层补上了,叫 WAM(World Action Models)。
| 比什么 | VLA(反应式) | WAM(预见式) |
|---|---|---|
| 它回答 | 「看到这样,我该做什么」 | 「如果我先这么做,接下来会变成什么样」 |
| 决策前会不会试 | 不会。一次前向就出动作 | 会。先在 |
| 像什么 | 像肌肉记忆:条件反射 | 像下棋时在心里走一遍:先算三步再落子 |
| 主要代价 | 遇到没见过的局面容易鲁莽 | 多花算力推演;而且模型一旦想错,它会自信地错 |
互动 · 想象是一棵树:埋头的深度,代价是指数
VLA 像一个熟练的摊主——手上在切,眼睛在看来的人,全靠条件反射,快。 WAM 像一个棋手——落子前先在脑子里走一遍:我这么走,对方会怎么应。
两种都对,但场景不同。切菜要快,下棋要想。真正的智能体两样都得有。
WAM 就是第 5 节那幅双联画在 2026 年的正式名字: 世界模型不再只预测游戏画面,它开始直接给动作当提议者。 它不一定是另一个模型:可以是「世界模型先推演、动作头再执行」两段接起来, 也可以两端合成一个;关键是决策前多了「先想一遍」这一步。
推演的每一步,误差都会被放大一遍、再叠上新偏差——所以是相乘,不是相加。把这件事拆开只有两个动作: 每一步,旧的差距先被放大 L 倍,再加上这一步新产生的偏差 ε。 L 是「这一步把旧差距放大几倍」,ε 是「这一步又添了多少新偏差」。 下面这张图就是这两句话在 24 步上的全部结果,拖 L 和 ε 看它怎么变。
互动 · 每走一步,旧的差距先被放大,再加一点新偏差
同一批误差,换成对数纵轴:相乘 = 一条直线,相加 = 一条越走越平
微型图解 · 差距是被「喂回去」的(这才是乘法的那一半)
把 L 拖到 1 以下(比如 0.9):误差会停在一个固定值——
每一步新加的 ε,和每一步被压缩掉的旧误差刚好抵消。这是「稳定的
把 L 拖到 1 以上(比如 1.2):误差指数上涨,而且只要 ε 不是 0,早晚都会爆——
这就是第 2、4 节那两条曲线分开的全部原因。
这个领域最常见的困惑是「论文里那个 90% 成功率到底说明什么」。答案是:看你考的是哪个基准。 先把方法家族放在一张表里,再把 2026 年最常被引用的五个基准放在另一张里。
| 方法家族 | 代表 | 关键一步 |
|---|---|---|
| 潜空间想象 | Dreamer v1 / v2 / v3 | 证明智能体可以完全在想象中训练,学出的策略拿到真实环境直接能用。 v3 把规模推到 Minecraft 里挖钻石 |
| 联合嵌入预测 | JEPA(I-JEPA / V-JEPA) | 主张不要在像素空间预测,而在抽象表示空间预测, 避免把算力浪费在无法预测的细节上(比如一片树叶的每条纹路) |
| 视频生成 | Sora、GAIA-1、Cosmos | 从海量视频里学到了相当强的物理直觉 |
| 交互式世界 | UniSim、Genie 2 | 不只预测未来,还接受动作输入。这是「 |
| 大规模真机模仿 | RT-1 | 用十几万条真机轨迹证明:数据规模能换来泛化,同一套网络能干几百个任务 |
| 把动作当语言 | RT-2、OpenVLA | 直接把视觉语言模型改造成能输出动作的模型,互联网知识第一次接进了操作 |
| 流匹配动作头 | π0 | 用 |
| 工程化 | World Labs、NVIDIA Cosmos | 把 |
互动 · 哪条路线真的「接受动作输入」
同一个词底下其实是两种东西:能接受动作、可以被用来做决策的,和只会往下画、不接受动作的。这条分界线才是「
时间轴 · 这条路线是怎么一步步走到今天的
上面这张表说的是「谁在推动这条线」。下面这张说的是另一件事: 怎么判断它到底行不行。五个基准难度和考点完全不同。 (表里的 OXE = Open X-Embodiment:21 家机构合作、覆盖 22 种机器人的真机操作数据合集。)
| 基准 | 考什么 | 在哪跑 | 难点在哪 |
|---|---|---|---|
| CALVIN | 长程任务:用语言指挥一串连续操作(开抽屉 → 拿出东西 → 放桌上) | 仿真 | 考听着人话把多步串起来。单步都对,串起来还是会崩 |
| LIBERO | 多任务学习:同一批场景里学几十个不同任务,看能不能互相帮忙 | 仿真 | 考知识迁移。学的任务多了,是变强还是互相打架 |
| SimplerEnv | 把真实世界的评测搬到仿真里复现,让结果可重复、可比较 | 仿真(对齐真实任务) | 考评测本身可不可信——仿真里赢了,真机一定赢吗 |
| RoboCasa | 家庭场景:厨房、餐桌,100 个日常任务、上千件 3D 素材 | 仿真 | 考日常生活有多难——干净实验室里会的,在杂乱厨房里未必会 |
| DROID | 真实机器人:跨多个实验室、多种机械臂的真实操作数据集与评测 | 真实机器人 | 考能不能在真实世界里稳定复现。最贵,也最诚实 |
互动 · 长程为什么会崩:单步都对,串起来还是会掉
读这类成绩单有三条规矩:① 先看在哪跑,仿真里的成功率普遍比真机高一截, 这不算作弊,但必须说清楚;② 再看任务有几类,一个任务 90% 和一个任务集平均 90% 不是同一回事; ③ 最后看长程有没有断,CALVIN 会报「连续完成了几步」, 那个数字通常比单步成功率难看得多,也更有信息量。
这一节把「世界模型自己的毛病」和「具身智能的毛病」放在一起算,能帮你省下不少被演示视频骗走的时间。 (规划器:拿世界模型当预测器、负责在候选动作里挑一个的那个模块。) 左边一列是问题,右边那一列是「什么时候真的会痛」。
| 问题 | 具体表现 | 什么时候真的会痛 |
|---|---|---|
| ① 误差累积 | 多步自回归预测,误差是复合的:单步的小偏差会相乘着长大 | 长视距规划。短视距 + 频繁重规划能压住它,但那只是权宜之计 |
| ② 分布外就崩 | 没见过的物体、光照、地形,预测会突然变得毫无道理,而且它自己不知道 | 部署到开放环境(家庭、街道)。训练分布以内,看不出这个问题 |
| ③ sim2real 鸿沟 | 仿真里的摩擦系数、质量、延迟永远和真实有偏差,而且这个偏差是系统性的 | 仿真里调好的参数搬到真机。系统性偏差靠多试几次平均不掉 |
| ④ 模型被利用 | 规划器会主动寻找模型预测错误的区域去刷分 | 模型有明显盲区的时候。「提高模型准确率」和「提高规划效果」不是同一件事 |
| ⑤ 评测没有共识 | FVD(视频质量)?下游任务成功率?物理一致性?不同论文用不同指标 | 横向比较论文结论。这和阶段 2 里 mAP 阈值不统一是同一类问题 |
| ⑥ 演示视频会骗人 | 固定工位、固定光照拍一条,「通用」通常指「训练见过的任务上通用」,失败的次数不会出现在视频里 | 看「机器人已经能进家庭/工厂」这类承诺。非结构化环境离可用还有明显距离 |
互动 · 规划器会主动去找模型「说错了」的地方刷分
互动 · 一旦走出训练分布,误差会突然抬头
互动 · 演示视频是怎么拍出来的
· 在受控环境里(游戏、仿真、固定桌面操作),已经相当可用;
· 在开放的真实世界里(家庭、街道、工厂),还远没到可靠的程度。
进展的速度,和「能不能用」是两件事。
打个比方:一个学生从 0 分考到 60 分,进步非常大;但 60 分还是不能毕业。 这个领域现在大概就在 60 分附近:方向对了,路还长。 「Sora 生成的视频看起来很符合物理」也不等于「它能当一个可用的世界模型」: 前者只要观感对,后者要求每次预测都准到能支撑决策。
前面 70 多章,每一章都属于七条线里的一条。作为收束章,这里一次说完:
它们在
回到第 5 节,把双联画的「模型与真实世界的偏差」从 25% 拖到 0:
想象和真实的轨迹合上了。再拖回 25%,看着它们分开。
这一章所有的结论都藏在这个滑块的两端之间:替身有多像,它就有多有用。
| 七条线 | 在世界模型 / 具身智能这里长什么样 |
|---|---|
| ① 表达力 vs 泛化 | 它要能模拟一切,又不能记住一切。 能模拟一切的极端是把训练数据背下来;记住一切的极端是一张查表。 好用的永远在中间——压成了规则,但没压得太死。 |
| ② 没有免费午餐 | 「世界怎么运转」这件事,模型生下来并不知道。 所以必须把物理先验塞进去:要么用手写的物理引擎, 要么用视频和交互数据喂出来。两种都不是免费的,只是账单形式不同。 |
| ③ 规模会赢 | 让它从「玩具」变成「有用」的那一步,靠的是视频 |
| ④ 学习即压缩 | 一个 |
| ⑤ 高维里的低维 | 低维里「看起来差不多」就真的差不多。 在高维状态空间里,两张画面逐像素几乎一样,物理却可能完全相反 (杯子往左倒还是往右倒)。所以模型可以「画得很像」而「决策很错」。 |
| ⑥ 层层组合 | 一次推一步、把上一步的输出当成下一步的输入——长轨迹和长任务都是这样一层层叠出来的。 代价也正好在这里:每叠一层,上一层的误差就再乘一次,所以推得越深越不准 (第 4 节那条误差累积曲线)。 |
| ⑦ 拧得动 | 它也是「只看脚下的坡」拧出来的:把预测下一帧的误差往下压,物理直觉就慢慢长了出来。 所以在训练分布里它很准(坡走得很好),一旦走出去就无坡可走—— 第 9 节那条突然抬头的曲线,就是这条线的边界。 |
暗线不占任何一章,但从感知机一路跟到这里。 这是它们最后一次出场,只挑还有话可说的三条。 (其余暗线本章没有特别的话,就不凑了。)
| 暗线 | 在世界模型与具身智能这里 |
|---|---|
| A 信息流动 | 观测(图像 H×W×3,或机器人状态)→ |
| C 参数账本 | 潜空间世界模型(Dreamer 级)约 10⁷~10⁸ 参数,视频世界模型到 10⁹~10¹⁰,开源 VLA 常见 3B~8B。 大头在两处:每轮规划要跑「候选条数 × 推演深度」次前向(如 60 条 × 20 步 = 1200 次,只为走一步), 这层规划跑在慢一个数量级的规划层、或批量并行在 GPU 上算,不塞进每个控制周期; 而文本语料按万亿 token 计,公开的真机操作数据像 DROID 也只有 7.6 万条轨迹、350 小时。参数可以堆,数据堆不出来。 |
| F 违背了哪个直觉 | 「会聊天就会动手」是错的(语言给的是陈述性知识,身体给的是程序性知识); 「预测得更准」≠「决策得更好」(规划器会去刷模型预测错的区域); 「看得更远」≠「做得更好」(越推越自信,也越偏)。 |
互动 · 参数可以堆,数据堆不出来
数据在时间上滚动(A);算力账花在「免费试很多次」上(C); 而最反直觉的一条是——它不会因为你算得更久就变得更对,只会变得更自信(F)。
读到最后一章,山的样子你已经见过了。剩下的事是挑一条路往下走—— 下面三条对应三种不同的好奇心,选你此刻最想满足的那一个就好。
| 你的好奇心 | 去哪 | 那一章解决什么 |
|---|---|---|
| 「它到底在想什么?」 想深入机制 |
机械可解释性 | 把黑箱拆开:注意力头、电路、特征各自在干什么。 这条路线想让「模型内部」变成能读的东西—— 也就直接回答了这一章最扎人的那句话:它知不知道自己漏了什么。 |
| 「我想自己训一个」 想动手做 |
症状与病因 · 超参怎么选 | 从一份默认配置出发:坏了怎么修(症状 → 病因的诊断树)、
能跑怎么调更好(学习曲线 → 该加数据还是该加模型)。 从业者 80~90% 的时间花在这两章讲的事情上,而不是推导公式。 |
| 「前面还有什么?」 想追前沿 |
递归自我改进(RSI) | 它问的是:当模型能改进自己的训练流程时,这个循环会走到哪。 这是当前共识最少、也最值得盯着的问题。 |
上一章《递归自我改进》问的是 AI 能不能改自己,这一章问的是它能不能动手改变世界。 如果是顺着读过来的:多模态给了「看图 + 读字」的能力, 强化学习给了「从分数里学行为」的机制, ViT 给了视觉编码的骨架。
只想把刚才那两条曲线再看明白,就回 数学急救包: 那里有矩阵乘法、导数、概率与对数、Σ 四个折叠附录,每块都配一张真算的小图。 术语忘了就翻 术语索引;想知道某一章的说法最早是谁提的, 每章底部都有一个「这一章的说法从哪来」。
上面讲的都是「够用」的版本。想往下挖,这里有三个入口—— 它们不是必修内容,是给想再往前走一步的读者准备的。