AI 必备数学基础(非数学党也能懂)
很多人被”学 AI 要先啃完高数线代”劝退。其实对应用者而言,建立直觉远比推导公式重要。这篇用大白话讲清三类数学在 AI 里到底”干什么用”,并给出零基础也能跟上的学习路径。
线性代数:AI 的”语言”
AI 处理的一切几乎都是数组:
- 向量(Vector):一个样本的特征,如 [年龄, 收入, 学历];
- 矩阵(Matrix):一批样本,每行一个人;
- 点积(Dot Product):衡量两个向量的”相似度/匹配程度”,是注意力的核心运算;
- 张量(Tensor):矩阵的推广,彩色图 = 高 × 宽 × 3 通道的三阶张量,大模型的权重就是高阶张量。
线性代数在 AI 里不是抽象符号,而是”如何高效批量做加权求和”。一次矩阵乘法,就是并行给成千上万个神经元算激活。
import numpy as np
# 一个样本(3维特征) 与 权重矩阵(3输入→2输出) 的加权求和
x = np.array([1.0, 0.5, 2.0])
W = np.array([[0.1, 0.2],
[0.3, 0.4],
[0.5, 0.6]])
print(x @ W) # 点积/矩阵乘:一次算出两个神经元的输入
概率与统计:训练像”调概率”
深度学习本质是统计建模:
- 分布(Distribution):数据长什么样,如”用户点击率服从某分布”;
- 期望(Expectation):平均意义上的结果,损失函数常是”期望风险”的经验估计;
- 贝叶斯(Bayes):用先验 + 观测更新信念,P(假设 | 数据) ∝ P(数据 | 假设) · P(假设);
- 交叉熵:把”预测概率”和”真实标签”的差距量化,训练就是最小化它。
直觉:模型不是记住答案,而是不断调整内部参数,让”真实数据出现的概率”最大——这正是最大似然估计的思想。
微积分:为什么梯度下降有效
- 导数(Derivative):函数在某点的变化率/斜率;
- 梯度(Gradient):多变量函数各方向的偏导组成的向量,指向”函数值上升最快”的方向;
- 链式法则(Chain Rule):复合函数求导法则,反向传播正是它的工程化实现。
梯度下降的逻辑:函数在某点沿”负梯度”方向下降最快。于是反复执行”参数 -= 学习率 × 梯度”,就能不断逼近损失最小值。
# 梯度下降直觉(一维)
def gradient_descent(f, df, x, lr=0.1, steps=100):
for _ in range(steps):
x = x - lr * df(x) # 沿负梯度走一小步
return x
建立直觉即可,不必啃教材
对绝大多数应用者(做产品、用 API、跑模型),你不需要推公式,只要能回答:
- 这个运算在”做什么”(点积 = 相似度,矩阵乘 = 批量加权);
- 这个损失在”惩罚什么”(预测错得越离谱,罚得越重);
- 这个更新在”往哪走”(沿负梯度减小损失)。
把这些想通,读论文、调模型就不再是天书。需要深造(如自研模型)时,再回头补严格推导。
推荐学习资源
- 3Blue1Brown《线性代数本质》系列:用几何动画建立直觉。 https://www.3blue1brown.com/topics/linear-algebra
- 吴恩达《Machine Learning Specialization》(DeepLearning.AI):把数学融进代码与可视化,零基础友好。 https://www.deeplearning.ai/courses/machine-learning-specialization/
- 李宏毅《机器学习》课程(台大):中文讲解深入,含大量作业。 https://speech.ee.ntu.edu.tw/~hylee/ml/2022-spring.php
- Goodfellow 等《Deep Learning》第 2 部分(应用数学基础)可作为查阅式教材。 https://www.deeplearningbook.org
三类数学如何串成一个训练闭环
把前面三点放到同一次训练里,就形成闭环:
- 线性代数负责”算”——前向传播用矩阵乘法批量得到预测;
- 概率统计负责”评”——用交叉熵等损失衡量预测概率与真实的差距;
- 微积分负责”改”——反向传播用链式法则算出梯度,梯度下降沿负梯度更新参数。
比如识别垃圾邮件:特征向量点乘权重(线性代数)得到分数,用 sigmoid 转成概率,再和真实标签算交叉熵(概率),最后反向传播更新权重(微积分)。读懂这个闭环,你就掌握了 AI 训练的骨架:矩阵算预测,梯度定方向,概率量好坏。
小结
- 线性代数在 AI 里是”批量加权求和的语言”:向量 = 样本,矩阵 = 批量,点积 = 相似度,张量 = 高阶数组。
- 概率视角下,训练 ≈ 最大化真实数据出现的概率(最大似然),损失函数量化预测偏差。
- 微积分里梯度指向上升最快方向,梯度下降沿负梯度逼近损失最小。
- 应用者重在建立直觉,不必死磕推导;需要自研模型再补严格数学。
- 3Blue1Brown、吴恩达、李宏毅三门资源是零基础到进阶的优质路径。
参考来源
- 3Blue1Brown. Essence of Linear Algebra. https://www.3blue1brown.com/topics/linear-algebra
- DeepLearning.AI. Machine Learning Specialization (Andrew Ng). https://www.deeplearning.ai/courses/machine-learning-specialization/
- 李宏毅 (Hung-yi Lee). Machine Learning 课程(国立台湾大学). https://speech.ee.ntu.edu.tw/~hylee/ml/2022-spring.php
- Goodfellow, I., Bengio, Y., Courville, A. Deep Learning(第 2 部分:应用数学与机器学习基础). MIT Press, 2016. https://www.deeplearningbook.org
本文累计阅读 — 次