索引 · 不是一章 · 不按顺序读

论文里的数学记号
一页查完

这一页原来是《数学地图》的附录。地图负责告诉你「这块数学在哪、干什么用」, 这一页负责「这个符号怎么念、什么意思」——一个是地图,一个是字典,所以分成了两页。
看到不认识的符号,按下面的搜索框;查完就回去。

阅

论文里最常见的 12 个符号

打开任意一篇深度学习论文,下面这 12 个符号出现率极高。 认得它们,就过了「读论文」的第一道坎。

符号怎么念一句话第一次出现在
θ西塔模型里全部可调参数的统称反向传播
η伊塔(学习率)每一步走多远,唯一必须手调的旋钮反向传播
∂偏只让一个变量动、其他按住不动时的变化率反向传播
∇纳布拉(梯度)把「对每个参数分别求导」打包成一个箭头反向传播
Σ西格玛(求和)把所有都加起来——它就是一个 for 循环损失函数
⊤转置把矩阵横过来;xᵀy 就是两个向量的内积注意力机制
⊙哈达玛积逐元素相乘(不是矩阵乘法!)LSTM
‖x‖范数这个向量有多长;也用来量「参数有多大」正则化
E[·]期望长期平均,不是某一次的结果初始化
KLK-L 散度两个分布差多少;永远 ≥ 0VAE
argmax取最大处不问最大是多少,只问最高的是哪一个采样
softmax软最大化把一串分数变成一串加起来等于 1 的概率注意力机制
🔤 还有一条没人讲、但所有人都会懵的约定

斜体小写 x = 一个数(标量) ·  粗体小写 x = 一串数(向量) ·  粗体大写 X = 一张表(矩阵)

论文里不解释这一条,因为它默认所有人都知道。现在你也知道了。

附

附录 · 论文里的数学记号

把任意一篇深度学习论文摊开,先卡住你的往往不是算法,是记号。 这个附录分三部分——下面那个搜索框一次过滤全部三类:

部分回答什么问题
① 基础运算符号 · 和 × 有什么区别? ⊙ 是什么?≜ 是「等于」还是「定义」? ~ 为什么读「服从」?
② 命名与上下标惯例 斜体 / 粗体 / 花体各指什么?i k t l 这些下标分别是谁? x(l) 为什么要加括号?
③ 全站专有符号 正文章节里悬停弹出的那些(自动生成,和悬停卡是同一份数据)

练一遍:把一行真公式读出来

这是交叉熵最标准的写法。用它把上面三部分一次全用上:

这一块怎么念什么意思
L损失 你要压下去的那个数。论文里常写成花体 𝓛——看到花体先想「这是个集合或函数,不是一个数」
−(1/N)负的 N 分之一 先平均、再取负。N 是样本数;负号的作用是把「最大化似然」翻成「最小化损失」
Σi=1N对 i 从 1 到 N 求和 把所有样本加起来。下标 i 是样本编号——这是惯例,不是定义
Σc对所有类别求和 把这个样本的每个候选类别都算一遍。下标 c 是类别编号(correct class)
yi,cy 下标 i 逗号 c 第 i 个样本、第 c 类的真实标签(通常只有正确答案那一项是 1)
ŷi,cy 帽 下标 i 逗号 c 帽子 = 模型的预测。这是模型给第 i 个样本、第 c 类的概率
log对数 把连乘变成连加,同时把「概率小到算不出来」拉回可计算的量级
💡 现在连起来读一遍

「把所有样本、所有类别,各自拿真实标签乘上『模型给这个答案的把握』的对数,加起来、取负、再平均。」

——这就是交叉熵。你刚才没用到任何算法知识,只用了这张记号表。

→

查完回哪

符号认得了,还想知道这块数学在干什么,回《数学地图》; 术语(不是符号)看不懂,去术语索引。