开始之前 · 第一性原理

这 77 章背后,
只有七个想法

先给你一张地图,只用大白话。
想看严格的形式,展开每张卡片:公式、假设,和一个能亲手做的实验。 后面的每一章,都能挂到这张图上的某一条线。

1

先讲个问题

假设你要学做菜。有人递给你一张清单:切菜、控火、调咸淡、勾芡、摆盘——每一项都讲得很细。 但你不知道这些拼起来能做什么菜,也不知道为什么要按这个顺序学。

这门课原本就有点这个毛病。它会从「感知机」开始,一步步讲到「具身智能」, 但如果你只跟着走,你会一直在爬山,却不知道山长什么样。

所以先看一眼「学习」本身长什么样。下面有 8 个点和一条直线,直线由两个旋钮决定: 斜率和高低。你先自己拧,把线对准那些点;再点「让它自己拧」,看机器怎么做。

学习 = 拧旋钮,直到错得最少

你刚才看到的就是全部的学习:一个带旋钮的函数、一个「错了多少」的分数、往让分数变小的方向拧。 后面 77 章里的模型,旋钮从 2 个变成了几千亿个。 这一章的七个想法,就是在拧旋钮时一定会撞上的七个问题:拧得太准会不会背答案?旋钮该怎么摆? 旋钮多到几千亿个,为什么还拧得动?……

所以这一章放在最前面

它不是目录。目录告诉你去哪里,这一章告诉你那些地方为什么值得去。

这是全课第一章,你没有欠账。下一章《数学地图》接着往下讲: 学习这一圈的每一步,背后各有一块数学,用的还是同一个例子。

2

学习的一圈:六个站

机器学习只做一件事:拿已有的数据,学出一个函数,让它对还没见过的数据也猜得准。 第 1 节那个「错得最少」只是路上的指示牌,终点是「猜得准未来」。

拿备考打个比方:练习册是已有的数据,考试是还没见过的新题。你做题、对答案、看错在哪、改学法,再做一遍。 没有人在乎练习册做得多熟,大家只看考试。下面就是这样的一圈,旋钮多了一点,一共 8 个。

学习的一圈 · 六个站,数字都是当场算的

先点几次「走一圈」,看清每一站在做什么;再点「连着走」,盯住右上角的两条线。 蓝线是练习册上的错,一直往下掉;橙线是新题上的错,掉到某处就掉头往上。 ③ 只看练习册,永远说「越来越好」。只有 ⑥ 说实话。

🎯 练习册和考试

做题 = ② 猜,对答案 = ③ 打分,看错题找原因 = ④ 找方向,改学法 = ⑤ 拧一步,考试 = ⑥ 考新题。

不一样的地方:真考试是一次性的,这里的新题是特意留出来的,只许验收、不许拿来学。 一旦拿它来调旋钮,它就成了第二本练习册,不再能代表未来。

六个站各需要一块数学。数学不是另一门课,是这六站的零件:

站这一站要解决什么靠哪块数学
① 变成数图片、文字、声音本来没法算线性代数:向量和矩阵,让东西能放进公式
② 猜用旋钮把输入算成预测线性代数:一次做很多个点积
③ 打分猜得多差要变成一个数;分类时,猜的本身就是一组概率信息论与概率:「平均有多意外」
④ 找方向几千亿个旋钮,各自该往哪拧链式法则:沿原路分责任,就是反向传播
⑤ 拧一步顺着坡走一小步微积分:放大到足够近,曲线就变直了
⑥ 考新题没见过的数据上也准吗概率与高维直觉

下一章《数学地图》用同一个例子把这一圈再走一遍,每一站回答三件事:卡在哪、数学做了什么、为什么这样够用又在哪不够。

3

整张地图,一次看完

下面是这 77 章的全部。 竖着的九列是「开篇」加八个阶段,从最左边的「开始之前」一路走到最右边的「前沿范式」。

拨动下面七个开关试试。每一条线都会点亮它穿过的那些章。 那些地方就是这门课真正的枢纽。

全站地图 · 拨开关看每条线穿过哪些章

🎯 把它想成地铁图

一张地铁图上有好几条线。有些站只有一条线经过,有些站是换乘站—— 三四条线都停。

换乘站最有价值:你只要在那里下车一次,就能换到完全不同的方向去。 后面你会遇到几个这样的换乘站,比如 transformer、scaling、embedding。

4

七个想法,逐个打开

每张卡片都是同一个格式:一句话说它是什么,一个类比让你记住, 一个反例告诉你它什么时候不成立;最后是学术版——它在论文里叫什么、 一个你能亲手做的小实验,玩过之后再看背后的那行公式。

5

七条线,各自管什么

这七条线不是并列的七个知识点。它们回答的是七个不同的问题,合起来是同一个大问题: 深度学习为什么能行。

线它回答的问题卡在哪一站什么时候你会用到它
表达力 vs 泛化
太死学不会,太活背答案
模型该有多灵活? ② 猜、⑥ 考新题 模型在训练集上很好、换一批数据就崩的时候
没有免费午餐
没有哪种模型什么都行
它凭什么通用? ② 猜 看到 CNN / RNN / Transformer 各有所长的时候
规模会赢
更大 + 更笨 > 更小 + 更巧
它靠什么变强? 整圈:数据、旋钮、算力一起放大 看到同一个架构放大十倍就突然会了新能力的时候
学习即压缩
懂了 = 忘得掉细节
它到底学到了什么? ③ 打分 看到 loss 下降、或者模型把数据压成一个向量的时候
高维里的低维
高维很吓人,但数据只占很薄一层
它凭什么能学? ① 变成数、⑥ 考新题 看到模型把高维数据压成一个短向量的时候
层层组合
简单的零件,一层层拼出复杂的东西
为什么要「深」? ② 猜 看到网络越叠越多层、每层学的东西越来越抽象的时候
拧得动
只看脚下的坡,也能走到很低的地方
几千亿个旋钮,凭什么拧得动? ④ 找方向、⑤ 拧一步 看到损失曲线一路往下走、或者训练突然炸掉的时候
⚠️ 这不是七个章节

它们是七根线,横着穿过所有章节。同一条线会在第一章出现,也会在第七十章再出现。 这正是不分章的原因——分了章,线就断了。

6

这张地图会骗你的地方

地图有用,但地图会骗人。七条线是七种看深度学习的角度,不是它的七个零件。

这张地图好的地方它会骗你的地方
让 77 章变成一个整体,而不是 77 个知识点 每章挂在哪条线上是人定的:同一章常常同时在好几条线上,地图只能替它挑一条主线
给你一个「这跟我之前学的有什么关系」的答案 真实的研究工作不是从这七个想法出发的,是从一个具体问题出发的
让「换乘站」显形——那些连接多个方向的章 每一章的内部细节,这张地图一个都没告诉你

先猜:这一章该挂在哪条线上?

💡 正确的用法

读到任何一章觉得「这跟我有什么关系」的时候,回到这一章,看它在哪条线上。

然后继续往下读。不要在这里停下来研究这七条线——它们只有在具体例子里才会真正有内容。

7

每章结尾都会问的六个问题

除了七条线,每章结尾还有一张六行的小表,叫暗线。两者分工不同:

比一比七条线六条暗线
回答什么深度学习为什么能行拆开一个方法时,该问它哪六件事
穿过哪些章每条线穿过一部分章每一章都问一遍
怎么用读完一章,想「它站在哪条线上」读完一章,用六个问题检查自己懂没懂

有几处容易混:暗线 E「它假设了什么」是第 ② 条线「没有免费午餐」落到某一章的具体样子; 暗线 C、D 是第 ③ 条线「规模会赢」的账本; 「这一章哪里反直觉」只归暗线 F,不归第 ⑤ 条线(⑤ 讲的是数据只住在高维空间里很薄的一层)。

暗线每章都会问的问题为什么值得问
A 信息流动数据从哪进来,从哪出去,中间变了什么形状形状对不上是 90% 报错的来源
B 什么被牺牲了这个方法为了让什么变好,放弃了什么没有免费的改进,只有交换
C 参数账本它有多少参数、多少计算量、多少显存规模是物理量,不是形容词
D 跑在什么上它算力受限还是带宽受限?最贵的动作是什么算法写出来不等于跑得动
E 它假设了什么这个设计偷偷假设了世界的什么性质假设破了,方法就失效
F 违背了哪个直觉这里有没有哪里跟常识相反反直觉处正是理解发生的地方

七条线穿过某些章,六个问题每章都问

8

小结

它对应哪条线七条全部——这一章就是它们本身
一句话学习是拿已有的数据拧旋钮,目的是对没见过的数据也猜得准;一圈六个站,77 章是在反复回答每一站撞上的七个问题
它牺牲了什么牺牲了「一章只讲一件事」的清爽——这一章故意讲得很宽,因为它必须在开头给一张地图
🎬 自己验一遍:这一章其实只有四个画面

画面一(第 1 节)。先自己拧两个旋钮,再点「让它自己拧」。 误差一步步往下掉,这就是全部的学习。

画面二(第 2 节)。点「连着走」,看右上角的两条线。 蓝线一路往下,橙线掉到某处就掉头:练习册上的好成绩,不等于考试。

画面三(第 3 节)。把两条线的开关一起拨开。 地图下方会多出一行「换乘站」,那些节点上套了两三圈彩色边框: 七个想法不是七个章节。

画面四(第 7 节)。拖那张点阵图的竖线。 上面七行会变,下面六行永远是满的。

一句话带走

学习就是拿已有的数据拧旋钮,让它对没见过的数据也猜得准:变成数、猜、打分、找方向、拧一步,再拿新题验收。这 77 章不是 77 个知识点, 是拧旋钮时撞上的七个问题在 77 个地方反复出现:
表达力 vs 泛化 · 没有免费午餐 · 规模会赢 · 学习即压缩 · 高维里的低维 · 层层组合 · 拧得动。
读到任何一章觉得迷路的时候,回到那张地图看一眼。

9

拓展阅读

上面讲的都是「够用」的版本。想往下挖,这里有三个入口—— 它们不是必修内容,是给想再往前走一步的读者准备的。

📄 这一章的说法从哪来

💻 工业界怎么写

∑ 更严格的形式

🔤 这些说法在论文里叫什么

七个想法在文献里各有一个正式名字。公式和假设已经在第 4 节每张卡片的「学术版」里讲过; 下面这张表是一张速查:「你记住的大白话」对应「论文里的术语」。 以后你在别处看到右边那一列,能认出来是这里讲过的东西:

你记住的大白话这一章叫它论文里叫它
太死学不会,太活背答案 表达力 vs 泛化 偏差–方差权衡(bias–variance tradeoff)· 双下降(double descent)
没有哪种模型什么都行 没有免费午餐 No Free Lunch 定理(Wolpert 1996)· 归纳偏置(inductive bias)
更大 + 更笨 > 更小 + 更巧 规模会赢 神经缩放律(neural scaling laws)· The Bitter Lesson(Sutton 2019)
懂了 = 忘得掉细节 学习即压缩 最小描述长度(MDL)· 信息瓶颈(information bottleneck)
高维很吓人,但数据只占很薄一层 高维里的低维 流形假设(manifold hypothesis)
简单的零件,一层层拼出复杂的东西 层层组合 层级表示 / 分布式表示(hierarchical / distributed representation)· 深度分离(depth separation,Telgarsky 2016)
只看脚下的坡,也能走到很低的地方 拧得动 非凸优化(non-convex optimization)· 鞍点(saddle point)· 过参数化(overparameterization)
⚠️ 诚实说:七条仍然不是全部

这一页原来只有五条线,并且在这里承认缺了两件:「为什么是深」和「为什么优化居然能成功」。 现在它们是第 ⑥ ⑦ 条。还缺的至少有一件:训练时见到的数据和真正用起来时遇到的不一样,会怎样(分布偏移)。 它散在评测、持续学习、安全几章里,还没有长成一条线。