阶段 8 · 前沿范式

世界模型与具身智能:先在脑子里
试一遍,再动手

上一章《递归自我改进》讲的是 AI 改自己;这一章往外走一步, 世界模型要预测的正是「如果我这么做,接下来会发生什么」。 具身智能再往前一步:它自己决定动作,然后承担后果。
有了世界模型,机器人不必真撞一百次墙才学会一件事:它可以在想象里撞。
这也是全课的最后一章。所以它还要回答读到这儿必然会冒出来的那个问题: 这些东西加起来,到底能做成什么?

1

真实的试错太贵了

模型不再只是「答得对不对」,它要真的动手做事, 于是会撞上两个绕不开的问题:试错太贵,而且语言模型没有身体。

先看第一个问题。在真实世界里失败一次,代价可能是撞坏机械臂、翻车,甚至伤人, 所以「让它多试几次就会了」这条最省事的路,一开始就走不通。 而把试错交给机器,就是强化学习在做的事: 没有标准答案,只有分数,自己试出来。 强化学习入门那一章把这件事完整讲了一遍。

试错方式一次尝试的成本能试多少次
在真实世界试 一次失败的代价可能是撞坏机械臂、翻车,甚至伤人 几百次就顶天了
在物理仿真里试 便宜,但仿真器和真实世界的物理参数总是不一样 几百万次
在世界模型里试 就是一次前向计算。而且模型是从真实数据里学出来的,比手写物理引擎更贴近真实 想要多少次就有多少次

互动 · 同样的预算,三条路各能试多少次

🎯 类比

你搬新家,要把一张沙发塞进客厅。你会怎么做?
不会真的把沙发抬起来试二十遍——你会先在脑子里过一遍:「先横过来、走到门口要侧一下、沙发脚可能会卡住……」
那个「在脑子里过一遍」的过程,用的就是你的世界模型。 你从小搬过很多东西,大脑已经学会了「物体怎么和空间互动」这套规律。
这个类比管到「先在脑子里过一遍」为止:你的大脑是练了很多年才准的; 模型的世界是从数据里现学的,数据没覆盖到的地方,它照样很自信。

顺着这个类比,世界模型就是一个能回答「如果我做 X,世界会变成什么样」的模型。 它不一定要预测像素:只要能在某个抽象层面上把「动作 → 未来」这个映射算出来,就够了。

第二个问题:就算试错不要钱,模型也未必会动手。 它能把「杯子掉下去会碎」讲得头头是道,还能列一段防止杯子掉落的注意事项。 但那两件事都不是物理常识:那是关于物理的句子,不是关于物理的手感。 杯子放在桌边、杯身已经有一半悬空时,最要紧的不是「它会不会碎」, 而是「我该先退后半步,还是先伸手扶住」。这个决定,它给不出来。

比什么语言模型知道具身智能必须知道
知识形态 陈述性:「是这样」——所有句子的统计规律 程序性:「该这么做」——一串带顺序的动作
出错的样子 说错一句,重说一遍就行 夹错位置,东西就碎了。没有「撤回」
怎么得到 读遍互联网上的文字 必须在真实世界里动过手,才能拿到反馈
时间尺度 可以想三分钟再答 必须在几十毫秒内给出下一步

互动 · 时间尺度:一边可以想三分钟,一边只有几十毫秒

2

想象能撑多远

想象不是越深越好。这句话和直觉反着来,所以先把它做成一个旋钮: 拖「想象深度」,看右边那条 真实 的误差曲线先往下、再掉头往上。 那个深度就是转移函数 f 被套在自己身上的次数:给出当前状态和动作,f 预测下一个状态 (它是拿大量「状态、动作、下一状态」的数据监督训出来的)。 谷底两边各夹着一种失败:推得太浅够不到目标,推得太深就被误差带偏;误差为什么会长成那样,第 4 节再拆。

互动 · 想象深度 vs 真实收益(真的跑动力学、真的搜索增益)

左 · 当前深度下的两条轨迹:蓝虚线 = 想象, 粉实线 = 真实

模型以为的误差
—
真实世界的误差
—
两者差多少
—

💡 核心大图 · 两条曲线,两种命运

蓝虚线是模型以为的自己。推演得越深,它就越有把握——误差稳稳地往 0 掉, 因为它一直在自己的世界里推自己,没有一条外部信息进来纠正它。

粉实线是真实世界。它先往下走(推得太浅确实够不到目标), 到一个最低点之后掉头往上:推演得越深,真实结果反而越差。

两条线之间越张越开的那道口子,就是这一章最想让你记住的东西—— 想象得越久,它离现实越远,而它自己毫无察觉。

操作:先找到那条真实误差曲线的最低点(上面那行读数会告诉你谷底在第几步),再往右拖几格,看它涨回去多少。 为什么会上涨?深度一长,模型在长链条上攒下的偏差就足够大: 拿世界模型做规划的那个模块,会非常自信地挑出一条在自己世界里完美、在真实世界里更差的动作。 深度越深,它越自信,也就错得越离谱。

所以「想得久一点总没错」是错的。想象的价值有一个上限, 而上限由「模型和现实隔多远」决定,不由你能算多久决定。

3

三条技术路线

路线预测什么代表特点
① 视频预测 直接预测未来的像素 Sora、Genie、Cosmos 直观、通用,能利用海量互联网视频。
但算力极贵,而且很容易把「看起来对」和「物理上对」混淆
② 潜空间模拟 先压成抽象表示,在潜空间里预测未来(JEPA 连像素都不还原) Dreamer v1-v3、JEPA 高效、稳定,真正用来训练智能体的那一类。 Dreamer 在 DeepMind Control 的 20 个连续控制任务上,只靠想象就把策略训了出来
③ 显式物理 / 3D 建模几何与物理规律本身(NeRF、3D 高斯泼溅:把场景存成可渲染的 3D 表示) NeRF、3D 高斯泼溅、可微物理引擎 可解释、可控,能保证一定的物理一致性。 难以泛化到没见过的场景

互动 · 一个「状态」要用多少个数字表示

「世界模型」不等于「视频生成模型」。 Sora 那条路线追求的是画得像;Dreamer 那条路线追求的是用来做决策够准。 一个世界模型可能画出来的画面很糊,但用来规划却很好用: 它关心的是「哪些细节对决策重要」,而不是「好不好看」。

4

误差会滚雪球

这是所有世界模型面对的第一号问题。下面做一次真实的抛体运动 rollout (rollout:把模型一步一步往前推,得到一串预测)—— 同一个初速度、同一套物理公式:「真实世界」用高精度积分(把运动方程按很小的时间步一点点算下去), 「模型」的参数有微小偏差。两条轨迹都是这样逐步算出来的。

互动 · 多步预测的误差累积(真实迭代计算)

金色 = 真实轨迹 绿色 = 模型预测

第 1 步偏差
—
第 20 步偏差
—
第 80 步偏差
—

如果误差是线性增长的,那预测多远都还能接受:误差除以步数是个常数。 但你看它长得更快。每一步的输入都是上一步的输出, 所以上一步的误差会变成这一步的输入偏置,然后继续放大。 这就是复合误差(compounding error):单步误差不是相加,而是相乘。 「相乘」的那笔账,在后面「数学 · 误差为什么是相乘长大的」一节里算。

⚠️ 试试把「重新对齐周期」调小

看误差曲线怎么被压回低位。
这是真实系统的标准做法:没人指望世界模型能准确预测 100 步之后。 大家用的是短视距预测 + 频繁重新规划—— 每走几步就用真实的观测把状态校正回来,然后再规划一次。
世界模型的价值不在「一次看得很远」,而在「每次都能快速试错」。

5

想象一遍,还是做一遍

这一节是一幅左右对照的双联画:左边在脑子里试,右边真做一遍。 任务很小:把一个质点从原点推到目标点。控制方式是一个比例控制器 a = k · (目标 − 位置),唯一的旋钮是增益 k(增益越大,动作越猛)。
两边跑的是同一个式子,只有 f 不一样:左边那套是模型以为的(增益偏弱、摩擦偏大), 右边那套是真实的。

互动 · 想象-行动双联画(真的跑动力学、真的搜索增益)

左 · 想象:只算,不执行

右 · 实际:真的执行

想象自认的误差
—
真实世界的误差
—
纯试错能到多少
—
想象 vs 实际 偏差
—

机器人怎么挑那个增益 k?它把 40 个候选增益各推演一遍,挑出自己以为终点离目标最近的那个。 在想象里跑这 40 条,只花算力(默认 40 条 × 5 步 = 200 次前向),几乎不要钱; 同样这 40 条要在真实世界里跑完,就是 200 步真实执行,机械臂会磨损、杯子会摔碎。 切到「只用实际」看看纯试错要花多少真实步数:同样的挑选,代价差几十倍。

把「模型与真实世界的偏差」往右拉,两幅画布上的轨迹会开始分叉。这就是 sim2real 鸿沟(sim = 仿真,real = 真实:两边规律对不上的那截差): 仿真里的摩擦力、质量、延迟永远和真实有出入,而且这个出入不是随机的,是系统性的, 所以不能靠多试几次平均掉。偏差甚至可能是反的:有些设定下模型会低估自己,真实结果反而更好。 重要的不是偏向哪边,而是你在想象里看不到这个偏差。

互动 · 偏差是系统性的:试再多次也平均不掉

随机噪声(试多了会抵消)
—
系统性偏差(抵消不掉)
—
试 40 次取平均后还剩
—

算笔账 · 一次推演到底在算什么

「推演」这个词听着玄,其实只有一句话:把同一个 f,一步接一步地套下去。 下面这张图会一步一步算给你看:每一步都拿上一步的结果,再问 f 同一个问题。

动画 · 推演一遍:每一步都在问 f 同一个问题

微型图解 · 这一步的两个箭头

在真实里试错,在模型里规划

上面那笔账只看了「推演一次」。把它放大成一个完整的任务: 把一个质点从起点推到目标点,中间挡着一个障碍物。 两种策略比的是消耗多少「真实环境」的步数。 每个方法都跑 5 个随机种子取平均:随机实验只跑一次就下结论,那是在挑数据。

互动 · 无模型试错 vs 有模型规划

纯试错:真实步数
—
有模型:真实步数
—
节省
—

纯试错:没有模型可问,只能挑一条动作序列在真实环境里跑完,看结果好不好,每一条都要付出真实代价。 有模型(MPC,Model Predictive Control:在模型里试几条,挑最好的执行,再重来):先在世界模型里免费地试 60 条,挑出最好的那条, 真实环境里只执行它,走完这段再重新规划。 区别一句话:一个把试错花在真实世界,一个把试错花在想象里。

这一节的图上有三个旋钮。第二个是模型对障碍的认知程度,它模拟 sim2real 鸿沟: 真实世界有这个障碍,但模型可能根本不知道它存在。 第三个是规划视距,一次规划多少步再重新决策,它决定了「你有多信任世界模型」。

互动 · 为了在真实世界走一步,要花多少次模型前向

把下面那张表画出来 · 视距越短,模型缺的那块知识越贵

⚠️ 试试把「规划视距」从最小拉到最大

先记住这个反直觉的实测结果。让模型不知道障碍物,只改规划视距(5 个随机种子取平均):

规划视距模型不知道障碍模型知道障碍差距
4 步205 步48 步4.3 倍
8 步155 步65 步2.4 倍
16 步116 步76 步1.5 倍
32 步110 步119 步基本持平
视距越短,模型缺的那块知识的代价越大。

为什么?因为短视距意味着频繁重新决策——而每一次重新决策, 都是拿那份错误的模型又算了一遍。智能体每 4 步就自信地朝着墙推一次, 撞墙、重规划、再撞墙,把错误反复重犯。

这跟「多重新规划几次总没错」的直觉正好相反。 重新规划的价值取决于「你依据的那个模型有多准」—— 如果你的世界模型漏掉了一整块约束,更频繁地咨询它只会让你更勤快地犯错。

同一种技能,要付多少次真实尝试

上面比的是同一个任务里的步数。把尺度再放大:达到同一个熟练度,各自要多少次真实尝试。 (遥操作:人用手柄或动捕设备遥控机器人做事,把轨迹录下来当示范。)

同一种技能,要付多少「真实尝试」

条形长度画的是数量级的对数——否则左边那条会是 0 像素宽。 数字是量级估计,不是精确值。

互动 · 纯试错 vs 用世界模型:同样的目标误差,要付多少次真实执行

🎯 类比

一个孩子看大人倒水几次,就学会了「杯子别倒太满」。 机器人要学会同一件事,可能要几千次真实尝试,每次都得真倒一杯水, 洒了还得有人来擦。
这就是具身智能最大的瓶颈:不是模型不够聪明,是「试」太贵。

6

给模型装上身体:VLA

世界模型回答「接下来会怎样」,可机器人要的是「我现在该做什么」。 近几年(从 RT-2 起),这个方向的主流做法叫 VLA(Vision-Language-Action): 视觉看懂场景 + 语言理解指令 + 直接输出动作。 它其实就是把多模态模型最右边那一段换掉: 前两段(视觉 + 语言)在阶段 2 和阶段 4 的多模态那章都讲过,真正新的是第三样。 输出层不再是从几万个 token 里挑一个,而是吐出一串连续的关节指令。

VLA 的数据流:输出层换成了动作

注意最后那个框:它一次吐出的不是一个动作,而是一段动作。 这段有多长各论文不同(ACT 约 100 步、π0 约 50 步),下面按 16 步算一段; 这叫动作分块(action chunking),理由是:每步都重新决策,机器人会抖, 就像你写字时不会每一笔都重新考虑握笔姿势。

互动 · 每步都重新决策,手会抖成什么样

动作怎么吐出来怎么做代价
① 直接回归 动作头就是一个全连接层,直接输出数值 容易输出「所有动作的平均」——两个都对的方案平均起来往往都不对
② 离散成 token 把每个动作维度切成若干格,当成词表,用预测下一个 token 的方式生成 能直接复用语言模型的整套训练方法。分辨率被切格数限制
③ 扩散 / 流匹配 把「一整段动作」当成一张要生成的图,用去噪或直线路径把它生成出来 能表达「有好几种都行」的动作分布,是现在开源 VLA 的主流(π0,Physical Intelligence 的机器人模型)。推理要多走几步去噪

互动 · 两种做法都对,取平均却两边都不是

互动 · 切成格子(做法 ②):省事,但精度被格数封顶

这条路线的核心想法,是把「动作」当成另一种语言: 既然 Transformer 能学「文字到文字」,它也能学「图 + 字 → 动作」, 只要把动作这一侧的表示问题解决好。这条路线能成,几乎全是Transformer 通用性的延伸。

难点为什么难
动作是连续的 语言模型输出的是「从几万个词里选一个」。机器人的动作是 6 个关节角度、每个都是浮点数——没法用 softmax 输出。 常见解法有三条:动作分块(各论文不同,ACT 约 100 步、π0 约 50 步)、扩散/流匹配生成轨迹、把动作离散成 token(RT-2 把每一维切成 256 档,见本节前面「动作怎么吐出来」那张表)
动作有后果 语言模型说错一句话,重说一遍就行。机器人夹错位置,可能把东西打碎。 容错率完全不同
没有互联网规模的机器人数据 文本和图像有几十亿的语料。真实机器人操作数据呢?公开的最大数据集之一 DROID 也只有 7.6 万条轨迹、350 小时。 这是具身智能最大的瓶颈
时间是一致的 语言可以来回修改,动作必须沿着时间轴往前推进,而且要在毫秒级做出反应

互动 · 连续动作怎么变成「能 softmax 的东西」

💡 数据问题的三条出路

① 遥操作采集——人穿着动捕设备或用手柄遥控机器人干活,把轨迹录下来。 质量最高,但人力极贵。
② 仿真合成——在物理引擎里生成海量轨迹。便宜,但存在 sim2real 鸿沟。
③ 从人类视频学习——网上有海量的做饭、修理、组装视频。 但视频里没有动作标签——你能看到手在切菜,但不知道关节力矩是多少。 这个「从观察到动作」的鸿沟是当前最活跃的研究方向之一。

7

先想象,再决定:WAM

VLA 是反应式的:看到这个,就做那个。它快,但它没有「如果……会怎样」这一层。 2026 年 5 月的一个新提法把这一层补上了,叫 WAM(World Action Models)。

比什么VLA(反应式)WAM(预见式)
它回答 「看到这样,我该做什么」 「如果我先这么做,接下来会变成什么样」
决策前会不会试 不会。一次前向就出动作 会。先在世界模型里把几条候选动作推演一遍
像什么 像肌肉记忆:条件反射 像下棋时在心里走一遍:先算三步再落子
主要代价 遇到没见过的局面容易鲁莽 多花算力推演;而且模型一旦想错,它会自信地错

互动 · 想象是一棵树:埋头的深度,代价是指数

🎯 类比

VLA 像一个熟练的摊主——手上在切,眼睛在看来的人,全靠条件反射,快。 WAM 像一个棋手——落子前先在脑子里走一遍:我这么走,对方会怎么应。

两种都对,但场景不同。切菜要快,下棋要想。真正的智能体两样都得有。

WAM 就是第 5 节那幅双联画在 2026 年的正式名字: 世界模型不再只预测游戏画面,它开始直接给动作当提议者。 它不一定是另一个模型:可以是「世界模型先推演、动作头再执行」两段接起来, 也可以两端合成一个;关键是决策前多了「先想一遍」这一步。

M

数学 · 误差为什么是相乘长大的

推演的每一步,误差都会被放大一遍、再叠上新偏差——所以是相乘,不是相加。把这件事拆开只有两个动作: 每一步,旧的差距先被放大 L 倍,再加上这一步新产生的偏差 ε。 L 是「这一步把旧差距放大几倍」,ε 是「这一步又添了多少新偏差」。 下面这张图就是这两句话在 24 步上的全部结果,拖 L 和 ε 看它怎么变。

互动 · 每走一步,旧的差距先被放大,再加一点新偏差

同一批误差,换成对数纵轴:相乘 = 一条直线,相加 = 一条越走越平

微型图解 · 差距是被「喂回去」的(这才是乘法的那一半)

🎬 自己验一遍

把 L 拖到 1 以下(比如 0.9):误差会停在一个固定值—— 每一步新加的 ε,和每一步被压缩掉的旧误差刚好抵消。这是「稳定的世界模型」。
把 L 拖到 1 以上(比如 1.2):误差指数上涨,而且只要 ε 不是 0,早晚都会爆—— 这就是第 2、4 节那两条曲线分开的全部原因。

8

方法家族,和它们的成绩单

这个领域最常见的困惑是「论文里那个 90% 成功率到底说明什么」。答案是:看你考的是哪个基准。 先把方法家族放在一张表里,再把 2026 年最常被引用的五个基准放在另一张里。

方法家族代表关键一步
潜空间想象Dreamer v1 / v2 / v3 证明智能体可以完全在想象中训练,学出的策略拿到真实环境直接能用。 v3 把规模推到 Minecraft 里挖钻石
联合嵌入预测JEPA(I-JEPA / V-JEPA) 主张不要在像素空间预测,而在抽象表示空间预测, 避免把算力浪费在无法预测的细节上(比如一片树叶的每条纹路)
视频生成Sora、GAIA-1、Cosmos 从海量视频里学到了相当强的物理直觉
交互式世界UniSim、Genie 2 不只预测未来,还接受动作输入。这是「世界模型」和「视频生成」的分界线
大规模真机模仿RT-1 用十几万条真机轨迹证明:数据规模能换来泛化,同一套网络能干几百个任务
把动作当语言RT-2、OpenVLA 直接把视觉语言模型改造成能输出动作的模型,互联网知识第一次接进了操作
流匹配动作头π0 用流匹配生成一整段动作轨迹,天然能表达「有好几种做法都行」
工程化World Labs、NVIDIA Cosmos 把世界模型做成可用的基础设施:可编辑、可控、可规模化

互动 · 哪条路线真的「接受动作输入」

同一个词底下其实是两种东西:能接受动作、可以被用来做决策的,和只会往下画、不接受动作的。这条分界线才是「世界模型」和「视频生成」的分界。

时间轴 · 这条路线是怎么一步步走到今天的

上面这张表说的是「谁在推动这条线」。下面这张说的是另一件事: 怎么判断它到底行不行。五个基准难度和考点完全不同。 (表里的 OXE = Open X-Embodiment:21 家机构合作、覆盖 22 种机器人的真机操作数据合集。)

基准考什么在哪跑难点在哪
CALVIN 长程任务:用语言指挥一串连续操作(开抽屉 → 拿出东西 → 放桌上) 仿真 考听着人话把多步串起来。单步都对,串起来还是会崩
LIBERO 多任务学习:同一批场景里学几十个不同任务,看能不能互相帮忙 仿真 考知识迁移。学的任务多了,是变强还是互相打架
SimplerEnv 把真实世界的评测搬到仿真里复现,让结果可重复、可比较 仿真(对齐真实任务) 考评测本身可不可信——仿真里赢了,真机一定赢吗
RoboCasa 家庭场景:厨房、餐桌,100 个日常任务、上千件 3D 素材 仿真 考日常生活有多难——干净实验室里会的,在杂乱厨房里未必会
DROID 真实机器人:跨多个实验室、多种机械臂的真实操作数据集与评测 真实机器人 考能不能在真实世界里稳定复现。最贵,也最诚实

互动 · 长程为什么会崩:单步都对,串起来还是会掉

读这类成绩单有三条规矩:① 先看在哪跑,仿真里的成功率普遍比真机高一截, 这不算作弊,但必须说清楚;② 再看任务有几类,一个任务 90% 和一个任务集平均 90% 不是同一回事; ③ 最后看长程有没有断,CALVIN 会报「连续完成了几步」, 那个数字通常比单步成功率难看得多,也更有信息量。

9

还没解决的问题

这一节把「世界模型自己的毛病」和「具身智能的毛病」放在一起算,能帮你省下不少被演示视频骗走的时间。 (规划器:拿世界模型当预测器、负责在候选动作里挑一个的那个模块。) 左边一列是问题,右边那一列是「什么时候真的会痛」。

问题具体表现什么时候真的会痛
① 误差累积 多步自回归预测,误差是复合的:单步的小偏差会相乘着长大 长视距规划。短视距 + 频繁重规划能压住它,但那只是权宜之计
② 分布外就崩 没见过的物体、光照、地形,预测会突然变得毫无道理,而且它自己不知道 部署到开放环境(家庭、街道)。训练分布以内,看不出这个问题
③ sim2real 鸿沟 仿真里的摩擦系数、质量、延迟永远和真实有偏差,而且这个偏差是系统性的 仿真里调好的参数搬到真机。系统性偏差靠多试几次平均不掉
④ 模型被利用 规划器会主动寻找模型预测错误的区域去刷分 模型有明显盲区的时候。「提高模型准确率」和「提高规划效果」不是同一件事
⑤ 评测没有共识 FVD(视频质量)?下游任务成功率?物理一致性?不同论文用不同指标 横向比较论文结论。这和阶段 2 里 mAP 阈值不统一是同一类问题
⑥ 演示视频会骗人 固定工位、固定光照拍一条,「通用」通常指「训练见过的任务上通用」,失败的次数不会出现在视频里 看「机器人已经能进家庭/工厂」这类承诺。非结构化环境离可用还有明显距离

互动 · 规划器会主动去找模型「说错了」的地方刷分

互动 · 一旦走出训练分布,误差会突然抬头

互动 · 演示视频是怎么拍出来的

⚠️ 一个冷静的判断

世界模型和具身智能都是过去两年最热的方向,但要说清它们现在在哪一步:
· 在受控环境里(游戏、仿真、固定桌面操作),已经相当可用;
· 在开放的真实世界里(家庭、街道、工厂),还远没到可靠的程度。 进展的速度,和「能不能用」是两件事。

打个比方:一个学生从 0 分考到 60 分,进步非常大;但 60 分还是不能毕业。 这个领域现在大概就在 60 分附近:方向对了,路还长。 「Sora 生成的视频看起来很符合物理」也不等于「它能当一个可用的世界模型」: 前者只要观感对,后者要求每次预测都准到能支撑决策。

10

小结

前面 70 多章,每一章都属于七条线里的一条。作为收束章,这里一次说完: 它们在世界模型和具身智能这里全都撞上了同一件事——想象和现实之间的那道缝。

它对应哪条线 ④ 学习即压缩——世界模型是把环境压成一套能推演的规则。 它不可能记住每一个细节(那等于把环境本身搬进来),只能留下「对决策重要的那部分」。 所以它永远是有损的,而且丢什么由它自己决定——这是它最危险的地方。 具身智能给这份压缩装上了一个行动的出口(回扣 ② 没有免费午餐:想要这份压缩, 要么掏先验,要么掏试错)。
一句话 世界模型在回答:「能不能用一份便宜得多的替身,替代真实世界来承担试错?」 答案是能;而具身智能把这个问题变成了一个动作:先在想象里试,再动手。 代价是替身和本尊之间那条缝,会随着推演深度一步步张开,而它自己不知道。
它牺牲了什么 它牺牲长期的正确性和出错可撤回的自由,去换短期的便宜: 一步预测几乎免费,但每多推一步就多乘一次自己的误差;真动手时没有「撤回」键。
🎬 自己验一遍

回到第 5 节,把双联画的「模型与真实世界的偏差」从 25% 拖到 0: 想象和真实的轨迹合上了。再拖回 25%,看着它们分开。
这一章所有的结论都藏在这个滑块的两端之间:替身有多像,它就有多有用。

七条线在世界模型 / 具身智能这里长什么样
① 表达力 vs 泛化 它要能模拟一切,又不能记住一切。 能模拟一切的极端是把训练数据背下来;记住一切的极端是一张查表。 好用的永远在中间——压成了规则,但没压得太死。
② 没有免费午餐 「世界怎么运转」这件事,模型生下来并不知道。 所以必须把物理先验塞进去:要么用手写的物理引擎, 要么用视频和交互数据喂出来。两种都不是免费的,只是账单形式不同。
③ 规模会赢 让它从「玩具」变成「有用」的那一步,靠的是视频预训练: 把互联网上所有「物体掉下来、水倒出来、门被推开」的画面喂进去, 物理直觉才第一次有了规模。这是规模律在具身这一侧的兑现。
④ 学习即压缩 一个世界模型就是环境的压缩。评价它好不好,等价于问一句: 这份压缩在多大的推演深度上还保真?——也就是上面那张图。
⑤ 高维里的低维 低维里「看起来差不多」就真的差不多。 在高维状态空间里,两张画面逐像素几乎一样,物理却可能完全相反 (杯子往左倒还是往右倒)。所以模型可以「画得很像」而「决策很错」。
⑥ 层层组合 一次推一步、把上一步的输出当成下一步的输入——长轨迹和长任务都是这样一层层叠出来的。 代价也正好在这里:每叠一层,上一层的误差就再乘一次,所以推得越深越不准 (第 4 节那条误差累积曲线)。
⑦ 拧得动 它也是「只看脚下的坡」拧出来的:把预测下一帧的误差往下压,物理直觉就慢慢长了出来。 所以在训练分布里它很准(坡走得很好),一旦走出去就无坡可走—— 第 9 节那条突然抬头的曲线,就是这条线的边界。
一句话带走世界模型与具身智能

世界模型是「如果我这么做,接下来会怎样」的预测器,价值是把试错从真实世界搬到想象里;代价是想象得越深它离现实越远,而它自己不知道——一份有损、很自信、越推越偏的替身。 所以呢:具身智能真正的瓶颈不是模型不够聪明,是真实试错太贵。

11

收束 · 暗线的答案

暗线不占任何一章,但从感知机一路跟到这里。 这是它们最后一次出场,只挑还有话可说的三条。 (其余暗线本章没有特别的话,就不凑了。)

暗线在世界模型与具身智能这里
A 信息流动 观测(图像 H×W×3,或机器人状态)→ 编码器压成潜空间状态 z(几百维), 再和语言 token 拼成一个序列 → 动作 a(6~7 维)或一整段动作块 T 步 × D 维 → 世界模型吐出下一个 z′,如此滚动。 形状第一次从「一次性的输入」变成了「沿着时间滚动的状态」。
C 参数账本 潜空间世界模型(Dreamer 级)约 10⁷~10⁸ 参数,视频世界模型到 10⁹~10¹⁰,开源 VLA 常见 3B~8B。 大头在两处:每轮规划要跑「候选条数 × 推演深度」次前向(如 60 条 × 20 步 = 1200 次,只为走一步), 这层规划跑在慢一个数量级的规划层、或批量并行在 GPU 上算,不塞进每个控制周期; 而文本语料按万亿 token 计,公开的真机操作数据像 DROID 也只有 7.6 万条轨迹、350 小时。参数可以堆,数据堆不出来。
F 违背了哪个直觉 「会聊天就会动手」是错的(语言给的是陈述性知识,身体给的是程序性知识); 「预测得更准」≠「决策得更好」(规划器会去刷模型预测错的区域); 「看得更远」≠「做得更好」(越推越自信,也越偏)。

互动 · 参数可以堆,数据堆不出来

🎯 暗线一起读,就是一件事

数据在时间上滚动(A);算力账花在「免费试很多次」上(C); 而最反直觉的一条是——它不会因为你算得更久就变得更对,只会变得更自信(F)。

12

出口 · 接下来往哪走

读到最后一章,山的样子你已经见过了。剩下的事是挑一条路往下走—— 下面三条对应三种不同的好奇心,选你此刻最想满足的那一个就好。

你的好奇心去哪那一章解决什么
「它到底在想什么?」
想深入机制
机械可解释性 把黑箱拆开:注意力头、电路、特征各自在干什么。 这条路线想让「模型内部」变成能读的东西—— 也就直接回答了这一章最扎人的那句话:它知不知道自己漏了什么。
「我想自己训一个」
想动手做
症状与病因 · 超参怎么选 从一份默认配置出发:坏了怎么修(症状 → 病因的诊断树)、 能跑怎么调更好(学习曲线 → 该加数据还是该加模型)。
从业者 80~90% 的时间花在这两章讲的事情上,而不是推导公式。
「前面还有什么?」
想追前沿
递归自我改进(RSI) 它问的是:当模型能改进自己的训练流程时,这个循环会走到哪。 这是当前共识最少、也最值得盯着的问题。

上一章《递归自我改进》问的是 AI 能不能改自己,这一章问的是它能不能动手改变世界。 如果是顺着读过来的:多模态给了「看图 + 读字」的能力, 强化学习给了「从分数里学行为」的机制, ViT 给了视觉编码的骨架。

只想把刚才那两条曲线再看明白,就回 数学急救包: 那里有矩阵乘法、导数、概率与对数、Σ 四个折叠附录,每块都配一张真算的小图。 术语忘了就翻 术语索引;想知道某一章的说法最早是谁提的, 每章底部都有一个「这一章的说法从哪来」。

13

拓展阅读

上面讲的都是「够用」的版本。想往下挖,这里有三个入口—— 它们不是必修内容,是给想再往前走一步的读者准备的。

📄 这一章的说法从哪来

💻 工业界怎么写

∑ 更严格的形式