🧠AI 基础
从零理解人工智能、机器学习与大模型的核心概念。
共 72 篇教程 · 7 个主题
注意力与 Transformer
8 篇 高效注意力:线性与稀疏注意力变体 讲解标准注意力的 O(n 平方) 瓶颈,以及稀疏注意力与线性注意力如何把复杂度降到近线性,帮你为长序列场景选型。 模型可解释性入门:从注意力归因到 SHAP 与 LIME 讲解为何大模型需要可解释性,手把手用注意力归因、集成梯度、LIME 与 SHAP 给模型预测找依据,并点出各类方法的局限。 注意力机制:QKV 怎么算 注意力用查询、键、值三组向量衡量相关性并加权聚合,是现代模型的核心。本文讲清 QKV 计算与缩放点积。 注意力机制入门:模型如何聚焦关键 注意力机制让模型在处理每个位置时,按相关性动态地给输入的不同部分分配权重,从而学会聚焦关键信息。本文从直觉讲到 Q K V,并给出缩放点积注意力的矩阵运算示例。 注意力机制深入:从加性注意力到多头与 FlashAttention 注意力机制让模型动态聚焦输入的相关部分,是现代大模型的算力核心。本文拆解加性注意力、缩放点积注意力、多头注意力、KV 缓存与 FlashAttention 的来龙去脉。 注意力可视化:如何看懂 Transformer 的注意力 讲解注意力热图的意义、BertViz 等可视化工具,以及如何用 Python 画出并读懂 Transformer 的注意力权重。 Transformer 架构:Attention 全景 Transformer 用自注意力替代循环与卷积,成为现代大模型的基础。本文讲清自注意力、多头注意力、位置编码与编码器解码器结构。 Transformer 架构详解:自注意力机制 详解 Transformer 的自注意力、多头机制与位置编码,对比 RNN/CNN,讲清它为何成为现代大模型的统一底座。
神经网络基础
12 篇 贝叶斯深度学习入门:从不确定性到贝叶斯神经网络 「贝叶斯深度学习」把神经网络权重当作分布而非单个点估计,借助先验与后验刻画认知不确定性,并用变分推断与 MC Dropout 为预测输出可信区间 残差连接:让深层网络可训 残差连接(Residual / Skip Connection)通过把输入直接加到输出,缓解深层网络的退化问题,使上百层的网络也能稳定训练。本文讲清原理、梯度通路与典型结构。 反向传播直观理解:链式法则与梯度流动 用直觉讲清反向传播如何把损失沿网络逐层回传、用链式法则计算梯度,并配合一个最小数值示例理解权重更新的本质。 激活函数:ReLU/GELU/Swish 对比 激活函数为神经网络引入非线性,使多层网络能拟合复杂函数。本文对比 Sigmoid、Tanh、ReLU 及其改进 GELU、Swish 的特性与选用建议。 卷积神经网络基础:从滤波器到特征图 卷积神经网络用滑动的滤波器在输入上提取局部特征,是现代视觉模型的基础。本文讲清卷积、填充、步长、池化与特征图的关系。 批量归一化:加速收敛 批量归一化(Batch Normalization)在每层激活前对 mini-batch 做标准化,缓解内部协变量偏移,稳定并加速深度网络训练。本文讲清原理、推理期行为与常见注意点。 深度学习基础:从感知机到神经网络 深度学习入门:从感知机到神经网络,讲清激活函数、前向/反向传播与CNN/RNN,帮你建立扎实基础。 神经架构搜索入门:让算法自动设计神经网络 从搜索空间、搜索策略到性能评估加速,系统梳理 NASNet、ENAS、DARTS 等主流神经架构搜索方法。 神经网络归一化技术:Batch/Layer/Instance/Group Norm 全解析 系统梳理 Batch Normalization、Layer Normalization、Instance Normalization 与 Group Normalization 的原理、公式、适用场景与 PyTorch 实现,帮你选对归一化方法。 图表示学习:从节点嵌入到图神经网络 图表示学习将节点、子图与整图编码为「保留结构与语义」的低维向量,本文从 DeepWalk、node2vec 讲到它与图神经网络的区别,并给出可运行的训练与可视化代码。 图神经网络基础:从 GCN 到 GraphSAGE 「图神经网络」是一类直接作用于非欧图结构的表示学习模型:本文从 GCN 的图卷积讲起,延伸到 GraphSAGE 的采样聚合与归纳式学习,并附 PyTorch Geometric 在 Cora 上的最小示例 RNN 与 LSTM:序列建模入门 循环神经网络用隐藏状态传递历史信息,适合处理文本、语音等序列数据。本文讲清 RNN 的原理、梯度消失问题,以及 LSTM 如何用门控缓解它。
训练与优化
12 篇 超参数调优入门:网格、随机与贝叶斯 讲清网格搜索、随机搜索、贝叶斯优化三类超参调优思路与落地注意。 过拟合与欠拟合:偏差方差权衡 过拟合指模型在训练集表现好却在未见数据上变差,欠拟合指模型连训练规律都没学到。本文用偏差方差权衡解释两者成因,并给出可操作的判断与应对方法。 交叉验证:稳健评估模型 交叉验证用多次划分训练验证集来估计模型泛化能力,比单次切分更稳健。本文讲清 K 折、分层与留一法,以及常见误用。 模型评估指标:困惑度、BLEU、ROUGE 与人类评估怎么用 系统梳理困惑度、BLEU、ROUGE、检索指标与人类/裁判评估的适用场景与陷阱,帮你为不同任务选对度量。 评估指标:准确率/F1/AUC 怎么选 评估指标决定我们如何判断模型好坏,选错会误导方向。本文对比准确率、精确率召回率 F1、ROC-AUC 与回归指标,说明各自的适用场景。 损失函数选型:分类回归全解 损失函数衡量预测与目标的差距,直接决定模型学什么。本文梳理回归与分类任务的常用损失,说明各自适用场景与数值注意点。 梯度下降变体:SGD/Adam/RMSProp 梯度下降是训练神经网络的基础优化器,SGD、Momentum、RMSProp、Adam 是它的主要变体。本文对比它们的更新规则、适用场景与常见陷阱。 学习率调度:warmup 与衰减 学习率是训练神经网络最敏感的超参数之一。学习率调度(warmup 与衰减)通过分阶段调整步长,兼顾早期稳定与后期收敛。本文讲清常见策略与选用思路。 优化器综述:从 SGD 到 Adam 的演进与选型 系统梳理 SGD、Momentum、RMSprop 与 Adam 等深度学习优化器的原理、更新公式与适用场景,帮你为不同任务选对优化器。 早停与正则:防过拟合实操 早停(Early Stopping)在验证集指标不再改善时停止训练,是代价最低的正则手段之一。本文讲清原理、耐心参数与和 dropout、权重衰减的配合。 正则化 L1/L2:抑制过拟合 L1 与 L2 正则通过在损失中加权重惩罚项约束模型复杂度,是抑制过拟合的基础手段。本文讲清两者公式差异、对权重的影响以及落地用法。 正则化技术:从 Dropout 到数据增强的过拟合对策 系统梳理神经网络常用的正则化手段:L1/L2 权重衰减、Dropout、早停、数据增强与批归一化,帮你有效抑制过拟合。
数学与统计
8 篇 贝叶斯方法:从朴素贝叶斯到推断 贝叶斯方法用概率表达不确定性,从朴素贝叶斯分类器延伸到后验推断。本文讲清贝叶斯定理、条件独立假设与推断思路。 贝叶斯优化:用更少试验调超参 贝叶斯优化用代理模型与采集函数,在每次试验后更新对目标函数的信念,从而把有限的调参预算集中在最有希望的区域。本文讲清它为什么比网格与随机搜索省试验,以及典型流程与局限。 度量学习:让相似更近、相异更远 度量学习不直接做分类,而是学习一个距离函数,使同类样本在嵌入空间彼此靠近、异类彼此远离。本文讲清它与孪生网络的关系、常用损失与落地场景。 降维:PCA 与 t-SNE 降维把高维数据压缩到更低维度,便于可视化与去噪。本文讲清 PCA 的线性投影与 t-SNE 的流形保持,以及各自适用场景。 因果推断入门:从相关到因果 「因果推断」以潜在结果框架与 do-operator 为理论内核,借助随机实验、工具变量与双重差分三类识别策略,把机器学习只能捕捉的相关关系升级为可干预、可解释的因果效应估计 AI 必备数学基础(非数学党也能懂) 用直觉讲清线性代数、概率统计与微积分在 AI 中的真实含义,并推荐 3Blue1Brown、吴恩达与李宏毅等优质学习资源。 PCA 降维:用主成分压缩特征 讲清 PCA 的思路、方差最大化与降维取舍,帮你用小维度保留大部分信息。 t-SNE 可视化:把高维数据看清楚 讲清 t-SNE 的邻域保持思路、困惑度作用与常见误用,帮你正确解读聚类图。
生成模型
4 篇经典模型与算法
18 篇 半监督学习:用少量标签撬动大量数据 半监督学习在少量标注加大量未标注数据上训练,利用数据自身的结构让模型学得更好。本文讲清一致性正则、伪标签与图方法等核心思路与适用场景。 集成学习进阶:Bagging、Boosting 与 Stacking 集成学习通过组合多个弱模型来降低方差或偏差,获得比单模型更稳更强的性能。本文讲清 Bagging、Boosting、Stacking 三类主流思路及其代表算法与适用场景。 集成学习入门:组合弱模型变强模型 讲清 Bagging、Boosting、Stacking 三类集成思路与典型算法,以及适用场景。 聚类基础:K-Means 与层级聚类 聚类在无标签数据中发现自然分组。本文讲清 K-Means 的迭代质心与层级聚类的树状结构,以及怎么选簇数。 决策树与随机森林 决策树靠规则分裂做可解释预测,随机森林用多棵树集成提升鲁棒性。本文讲清信息增益、过拟合与集成思路。 联邦学习入门:数据不动,模型动 讲清联邦学习的基本流程、为什么需要它,以及挑战(通信/异构/隐私)。 孪生网络:衡量样本相似度 孪生网络用一对共享权重的子网络把两张输入编码到同一向量空间,再用对比损失拉开异类、拉近同类,从而学会一种可复用的相似度度量。本文讲清它的结构、损失函数与典型用途。 模型压缩总览:剪枝、量化与蒸馏怎么选 系统梳理量化、剪枝与知识蒸馏三种模型压缩路线,对比精度、速度与显存权衡,并给出按部署场景的选型建议。 迁移学习进阶:用预训练撬动小数据 迁移学习把在一个任务上学到的知识迁移到相关的新任务,是缓解标注数据稀缺的核心技术。本文讲解微调、特征提取与领域自适应三类范式,以及预训练模型的选型要点。 迁移学习入门:把已有模型的知识迁移到新任务 从预训练与微调到领域自适应与少样本,系统讲清迁移学习的核心思路与典型做法。 强化学习基础:从 MDP 到 PPO 与 RLHF 强化学习通过与环境交互、以奖励为信号来学习策略,与监督学习有本质区别。本文讲清 MDP、价值函数、Q-learning、策略梯度、PPO,以及支撑大模型对齐的 RLHF。 强化学习基础:奖励与策略 强化学习让智能体在环境中靠奖励试错学习策略。本文讲清智能体、环境、奖励与价值函数,以及策略梯度思路。 时间序列预测入门:从 ARIMA 到 Informer 从经典统计模型 ARIMA、Prophet 讲到 Transformer 长序列模型 Informer 与 Autoformer,用「可复现实验」带你系统入门时间序列预测 异常检测入门:从数据里找出异常 讲清异常检测的核心思路、常用方法(统计/隔离森林/自编码器)与应用场景。 支持向量机 SVM 入门 SVM 寻找最大间隔超平面做分类,并用核技巧处理非线性。本文讲清间隔、核函数与软间隔正则。 主动学习:让模型挑要标注的数据 主动学习让模型自己挑出最值得标注的样本,把有限的人工标注预算用在刀刃上,从而在更少标签下达到更好的效果。本文讲清它的核心思路、常用采样策略与落地要点。 自编码器与 VAE:用压缩与重建学表征 自编码器把输入压缩到低维再重建,VAE 进一步让隐空间具备连续可采样性。本文讲清编码器-解码器结构、瓶颈、KL 散度与重参数化技巧。 自监督学习:让模型从数据自身学表征 自监督学习用数据自身构造监督信号,免去昂贵标注,是现代大模型预训练的基础。本文讲清 pretext task、对比学习、掩码建模及其与监督学习的区别。
表征与数据
10 篇 词嵌入:Word2Vec 到 Embedding 词嵌入把词语映射为稠密向量,让语义相近的词在空间中靠近。本文讲清 Word2Vec 与神经网络中的 Embedding 层。 对比学习入门:用相似与不相似样本学表征 从 InfoNCE 到 SimCLR、MoCo,理解对比学习如何不依赖标注就能学到好表征。 分词与 Tokenization:NLP 第一步 分词把文本切成模型可处理的 token,直接影响效果与成本。本文讲清词级、子词与字符级切分及 BPE。 分词与 Tokenizer 原理 从词级、字符级到子词算法,讲清神经网络为何必须先分词,以及 token 计费与中文分词的底层逻辑。 数据管道基础:从采集到入库 数据管道把分散在各处的原始数据,经过采集、清洗、转换最后落库,变成可分析可训练的干净数据。本文讲清一条基础管道的几个环节、常见组件与落地要点。 数据增强进阶:图像与文本增广实战 数据增强通过对训练样本做可控变换来扩充数据规模与多样性,是缓解过拟合、提升泛化能力的低成本手段。本文讲解图像与文本两类主流增广技法及其适用边界。 数据增强入门:用变换扩充训练样本 讲清数据增强的思路、常见变换与注意事项,帮助小数据集提升泛化。 特征工程进阶:从原始数据到模型输入 特征工程是把原始数据转化为模型可高效学习的表示的工序,常决定一个机器学习项目的上限。本文梳理数值、类别、文本与缺失值处理等核心技法,以及自动化趋势。 特征工程入门:从原始数据到模型可用特征 讲清特征工程的核心环节(清洗/编码/缩放/构造),以及它为何仍重要。 Embedding 与向量相似度:让机器理解语义 文本变成一串数字后,语义相近的向量也相近。本文讲清词向量、余弦相似度与现代 Embedding 模型,以及它如何支撑语义检索。
没有匹配的教程,换个关键词、难度或主题试试。