🤖大模型应用

微调、Agent、向量检索、RAG、推理部署、量化与多模态等大模型核心技术。

72 篇教程 · 8 个主题

架构与原理

15 篇
混合专家模型 MoE:用稀疏激活放大参数规模 「总参数巨大、每次只激活一小部分」是 MoE 的核心。本文讲清专家路由、Switch/DeepSeekMoE、Mixtral,以及它为何能在大参数下保持推理高效。 进阶 架构 混合专家模型(MoE):用稀疏激活扩展参数 从 Mixtral 到 DeepSeek,讲清 MoE 如何以更少算力激活更多参数。 进阶 应用 流式输出:token 逐字吐 流式输出让模型边生成边返回 token,改善等待体验;本文讲清其原理与实现方式。 上下文窗口:长文本怎么撑 上下文窗口限制模型一次可见的 token 数。本文讲清窗口受限的原因,以及位置插值、NTK、YaRN 等扩展长上下文的常用方法。 上下文窗口管理:长对话不丢重点 长对话或长文档任务中,上下文窗口限制会让早期信息被截断或稀释。本文给出滚动摘要、重要信息置顶与分层记忆等管理策略,并附一段对话摘要的示例代码。 上下文工程:长上下文、记忆与提示组织 解析「上下文工程(Context Engineering)」这一新兴范式:长上下文窗口的取舍、系统提示与动态上下文组装、短期/长期记忆管理,以及 Agent 场景中如何组织上下文以稳定输出。 进阶 上下文 投机解码:无损加速大模型生成 投机解码用一个小的草稿模型先猜若干 token,再由大模型并行验证,从而在保证输出不变的前提下显著提速。本文讲清原理、变体与适用场景。 进阶 加速 温度与 top-p:采样参数 温度与 top-p 控制生成随机性;本文讲清二者原理、区别与调参要点。 长上下文技术:突破窗口限制的方法 上下文窗口并非越大越好,长上下文带来注意力计算、检索精度与成本等挑战。本文梳理旋转位置编码、分块注意力、上下文压缩与检索增强等突破窗口限制的主流手段。 长上下文与位置编码 系统讲解 Transformer 自注意力为何需要位置信息,对比绝对位置、相对位置与 RoPE 旋转位置编码、ALiBi 线性偏置,并梳理 FlashAttention、Longformer 等高效长上下文注意力方案及 lost in the middle 问题。 进阶 位置编码 长文本生成与记忆:Agent 的长期记忆与摘要压缩 讲解 Agent 在处理长文档与长对话时的记忆架构,以及滚动摘要、检索式记忆等压缩与召回策略的取舍。 进阶 记忆 状态空间模型(SSM):超越注意力机制的高效序列建模 从 S4 到 Mamba,系统梳理选择性状态空间模型如何以线性复杂度处理长序列、挑战 Transformer。 进阶 应用 GPT 架构:Decoder-only 全景 GPT 采用仅解码器的 Transformer,靠因果掩码自回归生成文本。本文讲清其结构、预训练目标与为何成为大模型主流。 Logit Bias:定向控生成 Logit bias 在采样前加减词项分数来引导输出;本文讲清其原理、用法与局限。 RoPE 位置编码详解 RoPE 用旋转矩阵把位置信息注入注意力,使相对位置可由 query 与 key 的旋转差表示。本文讲清其数学形式与实现要点。

训练与对齐

10 篇
大模型微调:从 SFT 到 RLHF 与参数高效微调 系统讲解大模型微调的技术谱系:监督微调、RLHF、指令微调,以及 LoRA、QLoRA 等参数高效方法的原理、成本与适用场景。 进阶 微调 大模型训练范式:预训练、SFT、RLHF 与 DPO 一个大模型要经历预训练、监督微调、偏好对齐等多个阶段。本文对比各阶段的数据、目标函数与成本,讲清 SFT、RLHF、DPO 分别解决什么问题。 进阶 训练 大模型训练数据:采集、清洗、去重、配比与合规 梳理大模型训练数据的采集、清洗、去重、配比与合规全流程,说明数据质量与规模如何决定模型能力上限。 进阶 训练数据 过程奖励模型 PRM:让推理逐步可验证 过程奖励模型 PRM 把「只看最终答案对错」的评判,拆成「对每一步推理过程」的逐步打分,从而在数学、代码等复杂任务中更易发现早期错误、择优而行。 进阶 [PRM, 推理时计算, 奖励模型] 偏好对齐深入:从 RLHF 到 DPO 偏好对齐用人类偏好把大模型调教得更「有用、无害、诚实」,本文从 RLHF 的三阶段流程讲到 DPO 如何绕过奖励模型直接优化,并给出可运行的损失最小示例与取舍对比。 进阶 [对齐, RLHF, DPO] 推理模型与测试时计算:让模型慢思考 「思考得越久越准」成为新范式。本文讲清思维链、o1/DeepSeek-R1 的强化学习推理、过程奖励,以及它适用于哪些难题。 进阶 推理 推理时计算:用更多算力换更好答案 推理时计算在「不增大模型参数」的前提下,通过 Best-of-N、自洽、树搜索与长链式思考等方法,于「推理阶段」多花算力来换取更高的答案质量。 进阶 [推理时计算, Best-of-N, test-time] 指令微调:对齐人类意图 指令微调在预训练模型上用「指令-回答」数据继续训练,使其服从人类指令。本文讲清数据构造、训练方式与效果。 RLHF 与 DPO:对齐方法对比 RLHF 用奖励模型加强化学习对齐人类偏好,DPO 直接以偏好数据优化策略。本文对比二者流程、复杂度与取舍。 RLHF:让大模型对齐人类偏好 讲清 RLHF 的三步流程(SFT→奖励模型→PPO)与常用变体(DPO)。 进阶 应用

微调与压缩

15 篇
大模型量化:从原理到 4-bit 实战 解析「大模型量化(Model Quantization)」的核心动机与基础概念:显存、内存带宽与推理延迟的关系;INT8/INT4、权重量化与激活量化、对称/非对称量化、校准,以及 LLM.int8()、GPTQ、SmoothQuant、AWQ 四种代表方法与其 4-bit 落地实战。 进阶 量化 大模型量化:int8 与 int4 量化用低比特表示权重与激活,压缩显存、提升吞吐。本文讲清 int8 与 int4 的原理、LLM.int8() 与 GPTQ 等方法及取舍。 大模型量化入门:用更低精度换效率 量化把模型权重与激活从 16 位浮点降到 8 位甚至 4 位整数,在几乎不损精度的前提下大幅降低显存与延迟。本文讲清量化的基本思路、常见方案与取舍。 大模型推理部署:vLLM、KV Cache 与量化选型 拆解大模型服务化的核心难题:PagedAttention 与 KV Cache 管理、吞吐与延迟的权衡,以及 GPTQ/AWQ 量化与 vLLM、TensorRT-LLM、llama.cpp、TGI 的选型。 进阶 部署 大模型蒸馏:把大模型能力迁到小模型 知识蒸馏让小模型(student)通过模仿大模型(teacher)的输出分布来学习,从而在远低的推理成本下保留大部分能力。本文讲清软标签、温度软化与典型训练流程。 大模型蒸馏:知识迁移 知识蒸馏用大模型作为教师指导小模型训练;本文讲清其原理、代表方法与落地要点。 模型合并:把多个模型的权重融成一个 无需额外训练,就能把多个微调模型的权重按算法融合,得到兼顾多项能力的新模型。本文讲清任务算术、SLERP、TIES-Merging 与模型汤等方法。 进阶 合并 模型剪枝:削减参数而不崩精度 讲清结构化/非结构化剪枝、稀疏度与重训练(微调),以及落地收益与代价。 进阶 应用 模型量化深入实战:GPTQ 与 AWQ 怎么选怎么跑 深入对比 GPTQ 与 AWQ 两种主流权重量化方法的原理、校准集与硬件适配,并给出用 AutoGPTQ、llama.cpp 与 vLLM 跑 4-bit 模型的可运行示例。 进阶 量化 模型蒸馏:把大模型的知识压进小模型 用「软标签」让小模型模仿大模型的输出分布,是低成本部署的关键。本文讲清知识蒸馏原理、DistilBERT 与温度 softmax,以及它和量化的区别。 进阶 蒸馏 Embedding 微调:让向量更懂你的领域 讲清 Embedding 微调的思路、方法与在 RAG/搜索中的收益。 进阶 应用 KV 量化:显存再压缩 KV 量化把注意力缓存从高精度压到低位宽,降低显存占用;本文讲清其原理与用法。 KV Cache 量化与推理显存优化 解析「KV Cache 量化」如何把注意力机制里缓存的键值对从 FP16 压到 INT8、FP8 等低比特表示,从而降低推理显存占用、支撑更长上下文与更高并发,并对比权重量化、给出 vLLM、llama.cpp 与 AutoAWQ 的可运行配置示例。 进阶 [KV Cache, 量化, 推理优化] LoRA 微调:低秩适配 LoRA 冻结原权重,仅训练低秩适配矩阵,以极少显存微调大模型。本文讲清低秩分解、参数量与使用方法。 QLoRA:量化下微调 QLoRA 把基座量化到 4 比特再接 LoRA,单张消费级显卡即可微调大模型。本文讲清 NF4 量化与可微调适配的实现。

RAG 与向量检索

12 篇
多模态 RAG:让检索增强读懂图片与表格 讲解如何把图片、表格与版式纳入检索增强生成,覆盖图文联合嵌入、文档解析、多路召回与多模态大模型生成的典型架构。 进阶 多模态RAG 幻觉缓解:从检索到自省 检索增强与自省是缓解大模型幻觉的两类主线;本文讲清其原理与做法。 文档切片:RAG 召回质量的第一道关 讲清 RAG 文档切片的策略(按语义/结构/滑动窗口)与权衡。 进阶 应用 向量数据库基础:相似检索的引擎 向量数据库把文本、图片等转为向量后做近似最近邻检索,是语义搜索与 RAG 的底层引擎。本文讲清嵌入、索引与相似度度量等核心概念。 向量数据库与检索:Embedding、ANN 索引与 RAG 检索链路 讲透向量检索的底层原理:Embedding 与余弦相似度、HNSW/FAISS 等 ANN 索引,以及 Milvus、Pinecone、pgvector、Chroma 的对比与 RAG 实战。 进阶 检索 长文档 RAG 重排:ReRank 与递归检索让长文检索更准 讲解在 RAG 中用重排序模型与递归检索提升长文档、多文档场景的召回与精度,覆盖两阶段检索、混合检索与上下文压缩的取舍,并给出可运行示例。 进阶 Rerank 知识图谱 RAG:用图结构增强检索与推理 讲解如何把知识图谱引入检索增强生成,利用实体关系提升多跳问答与可解释性,并给出典型架构与开源方案。 进阶 图谱RAG 重排序模型:检索精排 重排序模型对初召回结果精细打分重排,提升检索精度。本文讲清交叉编码器原理、与向量召回的配合及用法。 Embedding 模型选型与对比:bge、e5 与 OpenAI 嵌入 对比主流文本 Embedding 模型的性能、维度、语言支持与部署成本,给出检索增强与聚类场景下的选型建议与可运行示例。 进阶 Embedding RAG 流水线设计:检索—增强—生成的要点 RAG 把检索到的相关资料塞进提示再让模型作答,缓解幻觉并接入私有知识。本文讲清切分、检索、重排与上下文组装等流水线关键环节。 RAG 实战:从文档切分到重排与评估 手把手讲透检索增强生成(RAG)的完整工程链路:文档解析与切分策略、Embedding 选型、向量检索与混合检索、重排序(Rerank)、上下文压缩,以及用 RAGAS 等指标评估质量与常见失效模式。 进阶 RAG RAG 系统评测:从检索质量到生成质量 系统梳理 RAG 的评测维度(召回/精度/忠实度/相关性)与常用指标、工具。 进阶 应用

Agent 与工具调用

7 篇

推理部署优化

7 篇

多模态

2 篇

评测与安全

4 篇