总览 · 知识地图

用眼睛,
而不是用公式搞懂深度学习

这里有 9 个阶段 · 77,从「一个神经元能算什么」一路讲到「大模型是怎么炼成的」。 每一章里几乎所有东西都能点、能拖、能播——你会看到数字真的在网络上流动、 卷积核真的在图片上一格一格滑过去、扩散模型真的从一团噪声里雕出图形。 读完留下的应该是画面,而不是定义。

1

这本站怎么用

你现在的状态建议怎么读
完全零基础 从侧边栏第一章《感知机》开始,按顺序往下。不要跳——每一章都用到上一章的东西。
学过一点,但概念混 直接跳到让你困惑的那一章。每章开头都写了「这章解决什么痛点」,可以快速定位。
只想看某个模型 / 打开侧边栏搜索,输 transformer扩散LoRA 都行。
想按「概念」读 翻到下面第 3 节。横跨阶段越多的概念,越是这门课的骨架——沿它把整条线读一遍。
💡 一个建议

看到互动面板时,先猜一下拖到最右边会发生什么,再去拖。 学习的发生点就在你猜错的那一刻——而不是在你看到正确结果的那一刻。

2

学习路线图

不按「模型类型」分章,按能力递进走:每一章解决上一章留下的一个具体痛点。 所以从第一章开始顺着读,不会出现「这个东西为什么要发明」的困惑。
这就是这门课读完的样子——77 章,全是能点开的。

3

跨阶段的桥

目录给的是一条线。但有些概念不只在某一章出现——它们横跨好几个阶段, 是「同一个想法在不同场景下反复出现」的证据。
这些横跨得最远的概念,才是整门课的骨架。

概念 × 阶段 · 圆点越大,说明这个阶段里带这个标签的章越多

💡 这张图怎么读

看一行读一行,不要看列。行是概念,列是阶段。
最上面那几行从左铺到右——比如「注意力」横跨阶段 2 / 3 / 4 / 6 / 8: 从 ViT 到 Transformer 到 DiT 到 KV Cache 到 Mamba。把这五章连着读,比按目录顺序读更能看出这个想法是怎么演化的。

反过来,短的行只有两三个点——那些是阶段内的专用工具,跟着阶段读就行,不用惦记。

🎯 为什么不直接给一张关系网

关系网看起来很漂亮,但它不能告诉你「先读哪个」——没有起点也没有终点, 你还是要自己找路。而且节点一多就会挤成一团毛球,看上去很复杂,实际上什么都没说。

这张点阵图小得多,但它每一行都直接对着一句能照做的事:「这个概念跨了 5 个阶段,沿它读一遍。」

4

概念词表

全书出现过的 43 个概念标签,按用在多少章排序。 点「还有 N 章」可以展开看全部。
这张表是算出来的:每章在课程清单里给自己打了几个标签,怎么归类全由标签决定。

概念用在几章横跨阶段代表章
💡 为什么强调「横跨几个阶段」

一个概念用在 15 章里,但全挤在同一个阶段——那它只是那段时期的热词,读完那个阶段就不用再想它了。
另一个概念只用在 8 章里,却横跨 5 个阶段——那它是骨架:不同年代、不同架构都在解它。 后者才值得你反复回头看。

5

这一章会骗你的地方

地图不是疆域。这一章只画了章与章之间的连线,一个字的正文内容都没画进去。

它帮你的地方它会骗你的地方
让你看见「哪两章其实在说同一件事」——目录里完全看不出来 关系是标签算出来的,不是人读出来的。标签打错了,表就排错了
新章自动出现在表里,这一章不用维护 它只排骨架:每一页内部讲了什么、难在哪,这里一个字都没有
告诉你「哪些概念横跨最多阶段」——这是最值得回头看的线索 「横跨多」不等于「对你重要」——你已经会的东西不在这张表里
横跨阶段多的概念,帮你把散在各章的同一件事串成一条线 「算不算横跨」按标签取并集,不是唯一正确的分类——换个标签集合,排名就变
💡 正确的用法

用它决定下一本读什么,不要用它代替读。
读完一章觉得「这跟前面哪一章有关系」——回到第 3 节那张图,看这个概念的线还穿过哪几个阶段,然后真的走过去读。

6

这一章要记住什么

🎯 一句话

这门课的知识地图,本质上是77 章之间的关系从概念标签里算出来—— 它一个字都不讲每章的内容,只讲章与章之间怎么连。
牺牲了顺序和细节:目录的顺序是作者排的、带着教学意图;这一章是无序的—— 它给你自由,也把「先读哪个」的决定权还给了你。

📴

零依赖 · 离线可用

纯静态 HTML + CSS + 原生 JS。没有框架、没有构建步骤、没有 CDN。 把整个文件夹下载下来,双击 index.html 就能看,断网也能看。

🧪

每一步都能自己验算

参数由你调,结果由公式算。梯度下降、卷积核、GRPO 的组内优势, 都可以拿纸笔对照着核一遍。

🌱

开源 · 随便用

代码 MIT,内容 CC BY-SA 4.0。可以转载、改编、做成讲义、放进付费课程, 只要署名 + 相同方式共享。

暗线这一章的回答
A 信息流动 数据流最短也最奇怪:77 份标签集合 → 254 条关系 → 三张表。 「形状」从一维目录变成一张带权无向图——能问的问题就变了: 目录只能问「下一章是什么」,图能问「谁和谁最像」「哪几个概念是骨架」。
B 什么被牺牲了 牺牲了顺序。目录里每一章的位置都是被编排过的,而这张图没有起点也没有终点—— 换来了「随便从哪章跳进去都行」的自由,代价是你要自己决定路线。
C 参数账本 这一章自己是零参数的——它不是训练出来的,是查表。 账本是 77 章 · 43 个标签 · 254 条关系; 算一次全部关系是 2926 对比较,成本可以忽略。
D 跑在什么上 查表,没有计算。这一章不用算任何一个数字—— 全部是从课程清单里数出来的。所以它不可能算错,只可能标签打错。
E 它假设了什么 假设「两章共享 ≥2 个概念标签,就真的同源」。 为什么门槛是 2 而不是 1:只共享 1 个标签的章太多了——几乎所有章都带「梯度」或「概率」, 门槛降到 1 会连成一团毛球,什么结构都看不出来。 这也正是泛化里那句老话:门槛定得太松,学到的就是噪声。
F 违背了哪个直觉 「最相关的两章应该挨着」是错的。 最长的一条关系横跨 65—— 过拟合与正则化持续学习与遗忘, 一个讲「怎么少背一点」,一个讲「为什么学新的会忘旧的」, 它们是同一个问题的两岸,却在目录里隔了 65 章。