这一页原来是《数学地图》的附录。地图负责告诉你「这块数学在哪、干什么用」,
这一页负责「这个符号怎么念、什么意思」——一个是地图,一个是字典,所以分成了两页。
看到不认识的符号,按下面的搜索框;查完就回去。
打开任意一篇深度学习论文,下面这 12 个符号出现率极高。 认得它们,就过了「读论文」的第一道坎。
| 符号 | 怎么念 | 一句话 | 第一次出现在 |
|---|---|---|---|
θ | 西塔 | 模型里全部可调参数的统称 | 反向传播 |
η | 伊塔(学习率) | 每一步走多远,唯一必须手调的旋钮 | 反向传播 |
∂ | 偏 | 只让一个变量动、其他按住不动时的变化率 | 反向传播 |
∇ | 纳布拉(梯度) | 把「对每个参数分别求导」打包成一个箭头 | 反向传播 |
Σ | 西格玛(求和) | 把所有都加起来——它就是一个 for 循环 | 损失函数 |
⊤ | 转置 | 把矩阵横过来;xᵀy 就是两个向量的内积 | 注意力机制 |
⊙ | 哈达玛积 | 逐元素相乘(不是矩阵乘法!) | LSTM |
‖x‖ | 范数 | 这个向量有多长;也用来量「参数有多大」 | 正则化 |
E[·] | 期望 | 长期平均,不是某一次的结果 | 初始化 |
KL | K-L 散度 | 两个分布差多少;永远 ≥ 0 | VAE |
argmax | 取最大处 | 不问最大是多少,只问最高的是哪一个 | 采样 |
softmax | 软最大化 | 把一串分数变成一串加起来等于 1 的概率 | 注意力机制 |
斜体小写 x = 一个数(标量) ·
粗体小写 x = 一串数(向量) ·
粗体大写 X = 一张表(矩阵)
论文里不解释这一条,因为它默认所有人都知道。现在你也知道了。
把任意一篇深度学习论文摊开,先卡住你的往往不是算法,是记号。 这个附录分三部分——下面那个搜索框一次过滤全部三类:
| 部分 | 回答什么问题 |
|---|---|
| ① 基础运算符号 | · 和 × 有什么区别?
⊙ 是什么?≜ 是「等于」还是「定义」?
~ 为什么读「服从」? |
| ② 命名与上下标惯例 | 斜体 / 粗体 / 花体各指什么?i k
t l 这些下标分别是谁?
x(l) 为什么要加括号? |
| ③ 全站专有符号 | 正文章节里悬停弹出的那些(自动生成,和悬停卡是同一份数据) |
这是交叉熵最标准的写法。用它把上面三部分一次全用上:
| 这一块 | 怎么念 | 什么意思 |
|---|---|---|
L | 损失 | 你要压下去的那个数。论文里常写成花体 𝓛——看到花体先想「这是个集合或函数,不是一个数」 |
−(1/N) | 负的 N 分之一 | 先平均、再取负。N 是样本数;负号的作用是把「最大化似然」翻成「最小化损失」 |
Σi=1N | 对 i 从 1 到 N 求和 | 把所有样本加起来。下标 i 是样本编号——这是惯例,不是定义 |
Σc | 对所有类别求和 | 把这个样本的每个候选类别都算一遍。下标 c 是类别编号(correct class) |
yi,c | y 下标 i 逗号 c | 第 i 个样本、第 c 类的真实标签(通常只有正确答案那一项是 1) |
ŷi,c | y 帽 下标 i 逗号 c | 帽子 = 模型的预测。这是模型给第 i 个样本、第 c 类的概率 |
log | 对数 | 把连乘变成连加,同时把「概率小到算不出来」拉回可计算的量级 |
「把所有样本、所有类别,各自拿真实标签乘上『模型给这个答案的把握』的对数,加起来、取负、再平均。」
——这就是交叉熵。你刚才没用到任何算法知识,只用了这张记号表。