深度学习论文中的数学符号字体选择:告别混乱,建立清晰规范
在撰写机器学习或深度学习论文时,数学符号的字体往往被许多人忽视。然而,混乱的字体使用会严重影响论文的可读性和专业度。比如:变量 (x) 和向量 (\mathbf{x}) 不加区分,损失函数 (\mathcal{L}) 和拉格朗日函数 (L) 混为一谈,会让审稿人和读者感到困惑。
本文将整理一套通用的数学字体使用规范,帮助你用字体传递数学对象的“身份”:它是变量还是常量,是标量还是张量,是固定权重还是流动数据。
0. 数学环境中的默认字体行为
在 LaTeX 数学环境中,不施加任何字体命令时:
- 运算符、数字、内置数学函数(如
\sin, \cos, \log, \lim, \max)、标点、括号、分隔符 均为正体。 - 英文字母(拉丁字母) 和 希腊字母 默认为斜体。
例如:
(α+β)⋅[1+2]={sin(x)+log(y)}. (\alpha + \beta) \cdot [1 + 2] = \{ \sin(x) + \log(y) \}. (α+β)⋅[1+2]={sin(x)+log(y)}.
因此,真正需要我们手动施加字体的只有“字母”(包括拉丁字母和希腊字母),其余元素无需额外干预。
下面进入核心内容:不同数学对象的字体对应关系。
1. 常量、单位与特殊符号:正体 (\mathrm)
常量指数值固定、不随上下文变化的量。
包括数学常数、物理常量、SI 单位、微分符号、化学符号等。
| 类型 | 示例 |
|---|---|
| 数学常数 | (\uppi, \mathrm{e}, \mathrm{i}) |
| 物理常量 | (\mathrm{c})(真空光速) |
| SI 单位 | (\mathrm{m}, \mathrm{kg}, \mathrm{s}) |
| 微分符号 | (\mathrm{d}x) |
- 希腊字母的正体需导入
upgreek宏包(如\uppi);若目标期刊不支持,可直接用斜体 (\pi) 代替。 - 化学符号通常有专用宏包(如
mhchem),但也遵循正体原则。
2. 物理量与一般标量:斜体(默认细斜体)
表示一个可以变化的物理量或标量,直接用数学环境的默认斜体即可。
质量 m,时间 t,力 F,坐标 x,y,α,β \text{质量 } m,\quad \text{时间 } t,\quad \text{力 } F,\quad \text{坐标 } x, y, \alpha, \beta 质量 m,时间 t,力 F,坐标 x,y,α,β
流形(Manifold)通常也用大写斜体,如 (M, N)。
3. 向量与矩阵:粗体,但要分“固定”与“流动”
在深度学习中,向量和矩阵常被分为两类语义:
- 流动的数据(中间特征/激活值):随输入变化,用粗斜体(
\bm或\boldsymbol) - 固定的参数(权重/偏置):网络学习得到的固有量,用粗正体(
\mathbf)
| 阶数 | 流动数据 | 固定参数 |
|---|---|---|
| 向量(1 阶) | (\boldsymbol{x}, \boldsymbol{h}) | (\mathbf{w}, \mathbf{b}) |
| 矩阵(2 阶) | (\boldsymbol{X}, \boldsymbol{A}) | (\mathbf{W}, \mathbf{U}) |
注意:
\mathbf只对拉丁字母有效,对希腊字母无效。要加粗希腊字母向量/矩阵,必须用\bm:
θ,α,Σ \bm{\theta}, \bm{\alpha}, \bm{\Sigma} θ,α,Σ
4. 高阶张量:多数情况沿用矩阵字体
在深度学习中,由于维度普遍很高,高阶张量与矩阵在字体上不做严格区分。
可以用与矩阵相同的粗斜体或粗正体表示,例如 (\mathbf{T}),(\boldsymbol{F}_{\mathrm{local}}),(\boldsymbol{\Psi})。
在纯数学语境中,高阶张量常用花体与矩阵区分,但机器学习论文中很少采用。
5. 函数名:自定义单字母用斜体,多字母用“运算符体”
- 单字母函数:(f, g) → 斜体即可。
- 多字母函数名:用
\operatorname(运算符体),可自动调整间距。
对比:
asoftmax(x)bvsasoftmax(x)b a \mathrm{softmax}(x) b \quad\text{vs}\quad a \operatorname{softmax}(x) b asoftmax(x)bvsasoftmax(x)b
常见用法:
Softmax(g), LN(Yres), MLP(⋅) \operatorname{Softmax}(\boldsymbol{g}),\; \operatorname{LN}(\boldsymbol{Y}_{\mathrm{res}}),\; \operatorname{MLP}(\cdot) Softmax(g),LN(Yres),MLP(⋅)
6. 集合、空间与分布:双线体与花体
-
标准五大数集:用双线体(
\mathbb)
(\mathbb{Q}, \mathbb{R}, \mathbb{C}, \mathbb{N}, \mathbb{Z}) -
自定义集合、数据集、空间、函数族、分布族:用花体(
\mathcal)
花体在机器学习理论文献中是一种强势惯例,告诉读者这是一个容器/集合/空间,而非一个点或数值。
示例:
数据集 D,输入空间 X,标签空间 Y,样本集合 S,函数族 H,正态分布 N(μ,σ2) \text{数据集 }\mathcal{D},\quad \text{输入空间 }\mathcal{X},\quad \text{标签空间 }\mathcal{Y},\quad \text{样本集合 }\mathcal{S},\quad \text{函数族 }\mathcal{H},\quad \text{正态分布 }\mathcal{N}(\mu,\sigma^2) 数据集 D,输入空间 X,标签空间 Y,样本集合 S,函数族 H,正态分布 N(μ,σ2)
小贴士:
“集合”通常指一堆具体的、异构的对象;
“族”则强调元素共享同一种结构或形式,只是参数不同,同构、可参数化生成。
你可以将“族”理解为“模板与实例”的关系。
7. 花体的争议与分辨:损失函数 vs 拉格朗日函数
为了区分常见的冲突对象:
- 损失函数用花体:(\mathcal{L})
- 拉格朗日函数用斜体:(L)
类似地,目标泛函 (\mathcal{J}) 可与雅可比矩阵 (J) 进行区分。
8. 字体命令能力速查表
| 字体命令 | 适用字母 | 希腊字母支持? | 备注 |
|---|---|---|---|
\mathrm |
拉丁字母 | ❌ | 正体 |
\mathbf |
拉丁字母 | ❌ | 粗正体 |
| 默认斜体 | 拉丁 + 希腊 | ✅ | 变量默认 |
\bm / \boldsymbol |
拉丁 + 希腊 | ✅ | 粗斜体;\boldsymbol 会同时加粗帽子等附属符号 |
\mathcal |
大写拉丁 | ❌ | 花体,集合/空间标识 |
\mathbb |
大写拉丁 | ❌ | 双线体,标准数集 |
\operatorname |
拉丁字母 | ❌ | 多字母运算符,间距优于 \mathrm |
\mathfrak |
拉丁字母 | ❌ | 哥特体,较少使用 |
9. 总结:用字体讲好数学故事
规范的字体会让论文的数学表达一目了然,其核心逻辑是区分变与不变、点与集合、流动与固定:
- 正体 = 常数、单位、微分(永不改变的事物)
- 斜体 = 变量、物理量(可变的数值)
- 粗斜体 = 流动数据向量/矩阵
- 粗正体 = 固定参数向量/矩阵
- 花体 = 集合、空间、分布(容器)
- 双线体 = 标准数集
遵循这套习惯,你的读者将能瞬间读懂符号的“身份”,而不再需要反复回溯定义。下次写论文时,不妨试着用字体为你的数学语言增加一层语义维度。
更多推荐

所有评论(0)