先给你一张地图,只用大白话。
想看严格的形式,展开每张卡片:公式、假设,和一个能亲手做的实验。
后面的每一章,都能挂到这张图上的某一条线。
假设你要学做菜。有人递给你一张清单:切菜、控火、调咸淡、勾芡、摆盘——每一项都讲得很细。 但你不知道这些拼起来能做什么菜,也不知道为什么要按这个顺序学。
这门课原本就有点这个毛病。它会从「感知机」开始,一步步讲到「具身智能」, 但如果你只跟着走,你会一直在爬山,却不知道山长什么样。
所以先看一眼「学习」本身长什么样。下面有 8 个点和一条直线,直线由两个旋钮决定: 斜率和高低。你先自己拧,把线对准那些点;再点「让它自己拧」,看机器怎么做。
学习 = 拧旋钮,直到错得最少
你刚才看到的就是全部的学习:一个带旋钮的函数、一个「错了多少」的分数、往让分数变小的方向拧。 后面 77 章里的模型,旋钮从 2 个变成了几千亿个。 这一章的七个想法,就是在拧旋钮时一定会撞上的七个问题:拧得太准会不会背答案?旋钮该怎么摆? 旋钮多到几千亿个,为什么还拧得动?……
它不是目录。目录告诉你去哪里,这一章告诉你那些地方为什么值得去。
这是全课第一章,你没有欠账。下一章《数学地图》接着往下讲: 学习这一圈的每一步,背后各有一块数学,用的还是同一个例子。
机器学习只做一件事:拿已有的数据,学出一个函数,让它对还没见过的数据也猜得准。 第 1 节那个「错得最少」只是路上的指示牌,终点是「猜得准未来」。
拿备考打个比方:练习册是已有的数据,考试是还没见过的新题。你做题、对答案、看错在哪、改学法,再做一遍。 没有人在乎练习册做得多熟,大家只看考试。下面就是这样的一圈,旋钮多了一点,一共 8 个。
学习的一圈 · 六个站,数字都是当场算的
先点几次「走一圈」,看清每一站在做什么;再点「连着走」,盯住右上角的两条线。 蓝线是练习册上的错,一直往下掉;橙线是新题上的错,掉到某处就掉头往上。 ③ 只看练习册,永远说「越来越好」。只有 ⑥ 说实话。
做题 = ② 猜,对答案 = ③ 打分,看错题找原因 = ④ 找方向,改学法 = ⑤ 拧一步,考试 = ⑥ 考新题。
不一样的地方:真考试是一次性的,这里的新题是特意留出来的,只许验收、不许拿来学。 一旦拿它来调旋钮,它就成了第二本练习册,不再能代表未来。
六个站各需要一块数学。数学不是另一门课,是这六站的零件:
| 站 | 这一站要解决什么 | 靠哪块数学 |
|---|---|---|
| ① 变成数 | 图片、文字、声音本来没法算 | 线性代数:向量和矩阵,让东西能放进公式 |
| ② 猜 | 用旋钮把输入算成预测 | 线性代数:一次做很多个点积 |
| ③ 打分 | 猜得多差要变成一个数;分类时,猜的本身就是一组概率 | 信息论与概率:「平均有多意外」 |
| ④ 找方向 | 几千亿个旋钮,各自该往哪拧 | 链式法则:沿原路分责任,就是反向传播 |
| ⑤ 拧一步 | 顺着坡走一小步 | 微积分:放大到足够近,曲线就变直了 |
| ⑥ 考新题 | 没见过的数据上也准吗 | 概率与高维直觉 |
下一章《数学地图》用同一个例子把这一圈再走一遍,每一站回答三件事:卡在哪、数学做了什么、为什么这样够用又在哪不够。
下面是这 77 章的全部。 竖着的九列是「开篇」加八个阶段,从最左边的「开始之前」一路走到最右边的「前沿范式」。
拨动下面七个开关试试。每一条线都会点亮它穿过的那些章。 那些地方就是这门课真正的枢纽。
全站地图 · 拨开关看每条线穿过哪些章
一张地铁图上有好几条线。有些站只有一条线经过,有些站是换乘站—— 三四条线都停。
换乘站最有价值:你只要在那里下车一次,就能换到完全不同的方向去。
后面你会遇到几个这样的换乘站,比如 transformer、scaling、embedding。
每张卡片都是同一个格式:一句话说它是什么,一个类比让你记住, 一个反例告诉你它什么时候不成立;最后是学术版——它在论文里叫什么、 一个你能亲手做的小实验,玩过之后再看背后的那行公式。
这七条线不是并列的七个知识点。它们回答的是七个不同的问题,合起来是同一个大问题: 深度学习为什么能行。
| 线 | 它回答的问题 | 卡在哪一站 | 什么时候你会用到它 |
|---|---|---|---|
| 表达力 vs 太死学不会,太活背答案 |
模型该有多灵活? | ② 猜、⑥ 考新题 | 模型在 |
| 没有免费午餐 没有哪种模型什么都行 |
它凭什么通用? | ② 猜 | 看到 CNN / RNN / Transformer 各有所长的时候 |
| 规模会赢 更大 + 更笨 > 更小 + 更巧 |
它靠什么变强? | 整圈:数据、旋钮、算力一起放大 | 看到同一个架构放大十倍就突然会了新能力的时候 |
| 学习即压缩 懂了 = 忘得掉细节 |
它到底学到了什么? | ③ 打分 | 看到 loss 下降、或者模型把数据压成一个向量的时候 |
| 高维里的低维 高维很吓人,但数据只占很薄一层 |
它凭什么能学? | ① 变成数、⑥ 考新题 | 看到模型把高维数据压成一个短向量的时候 |
| 层层组合 简单的零件,一层层拼出复杂的东西 |
为什么要「深」? | ② 猜 | 看到网络越叠越多层、每层学的东西越来越抽象的时候 |
| 拧得动 只看脚下的坡,也能走到很低的地方 |
几千亿个旋钮,凭什么拧得动? | ④ 找方向、⑤ 拧一步 | 看到损失曲线一路往下走、或者训练突然炸掉的时候 |
它们是七根线,横着穿过所有章节。同一条线会在第一章出现,也会在第七十章再出现。 这正是不分章的原因——分了章,线就断了。
地图有用,但地图会骗人。七条线是七种看深度学习的角度,不是它的七个零件。
| 这张地图好的地方 | 它会骗你的地方 |
|---|---|
| 让 77 章变成一个整体,而不是 77 个知识点 | 每章挂在哪条线上是人定的:同一章常常同时在好几条线上,地图只能替它挑一条主线 |
| 给你一个「这跟我之前学的有什么关系」的答案 | 真实的研究工作不是从这七个想法出发的,是从一个具体问题出发的 |
| 让「换乘站」显形——那些连接多个方向的章 | 每一章的内部细节,这张地图一个都没告诉你 |
先猜:这一章该挂在哪条线上?
读到任何一章觉得「这跟我有什么关系」的时候,回到这一章,看它在哪条线上。
然后继续往下读。不要在这里停下来研究这七条线——它们只有在具体例子里才会真正有内容。
除了七条线,每章结尾还有一张六行的小表,叫暗线。两者分工不同:
| 比一比 | 七条线 | 六条暗线 |
|---|---|---|
| 回答什么 | 深度学习为什么能行 | 拆开一个方法时,该问它哪六件事 |
| 穿过哪些章 | 每条线穿过一部分章 | 每一章都问一遍 |
| 怎么用 | 读完一章,想「它站在哪条线上」 | 读完一章,用六个问题检查自己懂没懂 |
有几处容易混:暗线 E「它假设了什么」是第 ② 条线「没有免费午餐」落到某一章的具体样子; 暗线 C、D 是第 ③ 条线「规模会赢」的账本; 「这一章哪里反直觉」只归暗线 F,不归第 ⑤ 条线(⑤ 讲的是数据只住在高维空间里很薄的一层)。
| 暗线 | 每章都会问的问题 | 为什么值得问 |
|---|---|---|
| A 信息流动 | 数据从哪进来,从哪出去,中间变了什么形状 | 形状对不上是 90% 报错的来源 |
| B 什么被牺牲了 | 这个方法为了让什么变好,放弃了什么 | 没有免费的改进,只有交换 |
| C | 它有多少参数、多少计算量、多少 | 规模是物理量,不是形容词 |
| D 跑在什么上 | 它 | 算法写出来不等于跑得动 |
| E 它假设了什么 | 这个设计偷偷假设了世界的什么性质 | 假设破了,方法就失效 |
| F 违背了哪个直觉 | 这里有没有哪里跟常识相反 | 反直觉处正是理解发生的地方 |
七条线穿过某些章,六个问题每章都问
画面一(第 1 节)。先自己拧两个旋钮,再点「让它自己拧」。 误差一步步往下掉,这就是全部的学习。
画面二(第 2 节)。点「连着走」,看右上角的两条线。 蓝线一路往下,橙线掉到某处就掉头:练习册上的好成绩,不等于考试。
画面三(第 3 节)。把两条线的开关一起拨开。 地图下方会多出一行「换乘站」,那些节点上套了两三圈彩色边框: 七个想法不是七个章节。
画面四(第 7 节)。拖那张点阵图的竖线。 上面七行会变,下面六行永远是满的。
学习就是拿已有的数据拧旋钮,让它对没见过的数据也猜得准:变成数、猜、打分、找方向、拧一步,再拿新题验收。这 77 章不是 77 个知识点,
是拧旋钮时撞上的七个问题在 77 个地方反复出现:
表达力 vs 泛化 · 没有免费午餐 · 规模会赢 · 学习即压缩 · 高维里的低维 · 层层组合 · 拧得动。
读到任何一章觉得迷路的时候,回到那张地图看一眼。
上面讲的都是「够用」的版本。想往下挖,这里有三个入口—— 它们不是必修内容,是给想再往前走一步的读者准备的。
七个想法在文献里各有一个正式名字。公式和假设已经在第 4 节每张卡片的「学术版」里讲过; 下面这张表是一张速查:「你记住的大白话」对应「论文里的术语」。 以后你在别处看到右边那一列,能认出来是这里讲过的东西:
| 你记住的大白话 | 这一章叫它 | 论文里叫它 |
|---|---|---|
| 太死学不会,太活背答案 | 表达力 vs 泛化 | 偏差–方差权衡(bias–variance tradeoff)· 双下降(double descent) |
| 没有哪种模型什么都行 | 没有免费午餐 | No Free Lunch 定理(Wolpert 1996)· 归纳偏置(inductive bias) |
| 更大 + 更笨 > 更小 + 更巧 | 规模会赢 | 神经缩放律(neural scaling laws)· The Bitter Lesson(Sutton 2019) |
| 懂了 = 忘得掉细节 | 学习即压缩 | 最小描述长度(MDL)· 信息瓶颈(information bottleneck) |
| 高维很吓人,但数据只占很薄一层 | 高维里的低维 | 流形假设(manifold hypothesis) |
| 简单的零件,一层层拼出复杂的东西 | 层层组合 | 层级表示 / 分布式表示(hierarchical / distributed representation)· 深度分离(depth separation,Telgarsky 2016) |
| 只看脚下的坡,也能走到很低的地方 | 拧得动 | 非凸优化(non-convex optimization)· 鞍点(saddle point)· 过参数化(overparameterization) |