🤖大模型应用
微调、Agent、向量检索、RAG、推理部署、量化与多模态等大模型核心技术。
共 72 篇教程 · 8 个主题
架构与原理
15 篇 混合专家模型 MoE:用稀疏激活放大参数规模 「总参数巨大、每次只激活一小部分」是 MoE 的核心。本文讲清专家路由、Switch/DeepSeekMoE、Mixtral,以及它为何能在大参数下保持推理高效。 混合专家模型(MoE):用稀疏激活扩展参数 从 Mixtral 到 DeepSeek,讲清 MoE 如何以更少算力激活更多参数。 流式输出:token 逐字吐 流式输出让模型边生成边返回 token,改善等待体验;本文讲清其原理与实现方式。 上下文窗口:长文本怎么撑 上下文窗口限制模型一次可见的 token 数。本文讲清窗口受限的原因,以及位置插值、NTK、YaRN 等扩展长上下文的常用方法。 上下文窗口管理:长对话不丢重点 长对话或长文档任务中,上下文窗口限制会让早期信息被截断或稀释。本文给出滚动摘要、重要信息置顶与分层记忆等管理策略,并附一段对话摘要的示例代码。 上下文工程:长上下文、记忆与提示组织 解析「上下文工程(Context Engineering)」这一新兴范式:长上下文窗口的取舍、系统提示与动态上下文组装、短期/长期记忆管理,以及 Agent 场景中如何组织上下文以稳定输出。 投机解码:无损加速大模型生成 投机解码用一个小的草稿模型先猜若干 token,再由大模型并行验证,从而在保证输出不变的前提下显著提速。本文讲清原理、变体与适用场景。 温度与 top-p:采样参数 温度与 top-p 控制生成随机性;本文讲清二者原理、区别与调参要点。 长上下文技术:突破窗口限制的方法 上下文窗口并非越大越好,长上下文带来注意力计算、检索精度与成本等挑战。本文梳理旋转位置编码、分块注意力、上下文压缩与检索增强等突破窗口限制的主流手段。 长上下文与位置编码 系统讲解 Transformer 自注意力为何需要位置信息,对比绝对位置、相对位置与 RoPE 旋转位置编码、ALiBi 线性偏置,并梳理 FlashAttention、Longformer 等高效长上下文注意力方案及 lost in the middle 问题。 长文本生成与记忆:Agent 的长期记忆与摘要压缩 讲解 Agent 在处理长文档与长对话时的记忆架构,以及滚动摘要、检索式记忆等压缩与召回策略的取舍。 状态空间模型(SSM):超越注意力机制的高效序列建模 从 S4 到 Mamba,系统梳理选择性状态空间模型如何以线性复杂度处理长序列、挑战 Transformer。 GPT 架构:Decoder-only 全景 GPT 采用仅解码器的 Transformer,靠因果掩码自回归生成文本。本文讲清其结构、预训练目标与为何成为大模型主流。 Logit Bias:定向控生成 Logit bias 在采样前加减词项分数来引导输出;本文讲清其原理、用法与局限。 RoPE 位置编码详解 RoPE 用旋转矩阵把位置信息注入注意力,使相对位置可由 query 与 key 的旋转差表示。本文讲清其数学形式与实现要点。
训练与对齐
10 篇 大模型微调:从 SFT 到 RLHF 与参数高效微调 系统讲解大模型微调的技术谱系:监督微调、RLHF、指令微调,以及 LoRA、QLoRA 等参数高效方法的原理、成本与适用场景。 大模型训练范式:预训练、SFT、RLHF 与 DPO 一个大模型要经历预训练、监督微调、偏好对齐等多个阶段。本文对比各阶段的数据、目标函数与成本,讲清 SFT、RLHF、DPO 分别解决什么问题。 大模型训练数据:采集、清洗、去重、配比与合规 梳理大模型训练数据的采集、清洗、去重、配比与合规全流程,说明数据质量与规模如何决定模型能力上限。 过程奖励模型 PRM:让推理逐步可验证 过程奖励模型 PRM 把「只看最终答案对错」的评判,拆成「对每一步推理过程」的逐步打分,从而在数学、代码等复杂任务中更易发现早期错误、择优而行。 偏好对齐深入:从 RLHF 到 DPO 偏好对齐用人类偏好把大模型调教得更「有用、无害、诚实」,本文从 RLHF 的三阶段流程讲到 DPO 如何绕过奖励模型直接优化,并给出可运行的损失最小示例与取舍对比。 推理模型与测试时计算:让模型慢思考 「思考得越久越准」成为新范式。本文讲清思维链、o1/DeepSeek-R1 的强化学习推理、过程奖励,以及它适用于哪些难题。 推理时计算:用更多算力换更好答案 推理时计算在「不增大模型参数」的前提下,通过 Best-of-N、自洽、树搜索与长链式思考等方法,于「推理阶段」多花算力来换取更高的答案质量。 指令微调:对齐人类意图 指令微调在预训练模型上用「指令-回答」数据继续训练,使其服从人类指令。本文讲清数据构造、训练方式与效果。 RLHF 与 DPO:对齐方法对比 RLHF 用奖励模型加强化学习对齐人类偏好,DPO 直接以偏好数据优化策略。本文对比二者流程、复杂度与取舍。 RLHF:让大模型对齐人类偏好 讲清 RLHF 的三步流程(SFT→奖励模型→PPO)与常用变体(DPO)。
微调与压缩
15 篇 大模型量化:从原理到 4-bit 实战 解析「大模型量化(Model Quantization)」的核心动机与基础概念:显存、内存带宽与推理延迟的关系;INT8/INT4、权重量化与激活量化、对称/非对称量化、校准,以及 LLM.int8()、GPTQ、SmoothQuant、AWQ 四种代表方法与其 4-bit 落地实战。 大模型量化:int8 与 int4 量化用低比特表示权重与激活,压缩显存、提升吞吐。本文讲清 int8 与 int4 的原理、LLM.int8() 与 GPTQ 等方法及取舍。 大模型量化入门:用更低精度换效率 量化把模型权重与激活从 16 位浮点降到 8 位甚至 4 位整数,在几乎不损精度的前提下大幅降低显存与延迟。本文讲清量化的基本思路、常见方案与取舍。 大模型推理部署:vLLM、KV Cache 与量化选型 拆解大模型服务化的核心难题:PagedAttention 与 KV Cache 管理、吞吐与延迟的权衡,以及 GPTQ/AWQ 量化与 vLLM、TensorRT-LLM、llama.cpp、TGI 的选型。 大模型蒸馏:把大模型能力迁到小模型 知识蒸馏让小模型(student)通过模仿大模型(teacher)的输出分布来学习,从而在远低的推理成本下保留大部分能力。本文讲清软标签、温度软化与典型训练流程。 大模型蒸馏:知识迁移 知识蒸馏用大模型作为教师指导小模型训练;本文讲清其原理、代表方法与落地要点。 模型合并:把多个模型的权重融成一个 无需额外训练,就能把多个微调模型的权重按算法融合,得到兼顾多项能力的新模型。本文讲清任务算术、SLERP、TIES-Merging 与模型汤等方法。 模型剪枝:削减参数而不崩精度 讲清结构化/非结构化剪枝、稀疏度与重训练(微调),以及落地收益与代价。 模型量化深入实战:GPTQ 与 AWQ 怎么选怎么跑 深入对比 GPTQ 与 AWQ 两种主流权重量化方法的原理、校准集与硬件适配,并给出用 AutoGPTQ、llama.cpp 与 vLLM 跑 4-bit 模型的可运行示例。 模型蒸馏:把大模型的知识压进小模型 用「软标签」让小模型模仿大模型的输出分布,是低成本部署的关键。本文讲清知识蒸馏原理、DistilBERT 与温度 softmax,以及它和量化的区别。 Embedding 微调:让向量更懂你的领域 讲清 Embedding 微调的思路、方法与在 RAG/搜索中的收益。 KV 量化:显存再压缩 KV 量化把注意力缓存从高精度压到低位宽,降低显存占用;本文讲清其原理与用法。 KV Cache 量化与推理显存优化 解析「KV Cache 量化」如何把注意力机制里缓存的键值对从 FP16 压到 INT8、FP8 等低比特表示,从而降低推理显存占用、支撑更长上下文与更高并发,并对比权重量化、给出 vLLM、llama.cpp 与 AutoAWQ 的可运行配置示例。 LoRA 微调:低秩适配 LoRA 冻结原权重,仅训练低秩适配矩阵,以极少显存微调大模型。本文讲清低秩分解、参数量与使用方法。 QLoRA:量化下微调 QLoRA 把基座量化到 4 比特再接 LoRA,单张消费级显卡即可微调大模型。本文讲清 NF4 量化与可微调适配的实现。
RAG 与向量检索
12 篇 多模态 RAG:让检索增强读懂图片与表格 讲解如何把图片、表格与版式纳入检索增强生成,覆盖图文联合嵌入、文档解析、多路召回与多模态大模型生成的典型架构。 幻觉缓解:从检索到自省 检索增强与自省是缓解大模型幻觉的两类主线;本文讲清其原理与做法。 文档切片:RAG 召回质量的第一道关 讲清 RAG 文档切片的策略(按语义/结构/滑动窗口)与权衡。 向量数据库基础:相似检索的引擎 向量数据库把文本、图片等转为向量后做近似最近邻检索,是语义搜索与 RAG 的底层引擎。本文讲清嵌入、索引与相似度度量等核心概念。 向量数据库与检索:Embedding、ANN 索引与 RAG 检索链路 讲透向量检索的底层原理:Embedding 与余弦相似度、HNSW/FAISS 等 ANN 索引,以及 Milvus、Pinecone、pgvector、Chroma 的对比与 RAG 实战。 长文档 RAG 重排:ReRank 与递归检索让长文检索更准 讲解在 RAG 中用重排序模型与递归检索提升长文档、多文档场景的召回与精度,覆盖两阶段检索、混合检索与上下文压缩的取舍,并给出可运行示例。 知识图谱 RAG:用图结构增强检索与推理 讲解如何把知识图谱引入检索增强生成,利用实体关系提升多跳问答与可解释性,并给出典型架构与开源方案。 重排序模型:检索精排 重排序模型对初召回结果精细打分重排,提升检索精度。本文讲清交叉编码器原理、与向量召回的配合及用法。 Embedding 模型选型与对比:bge、e5 与 OpenAI 嵌入 对比主流文本 Embedding 模型的性能、维度、语言支持与部署成本,给出检索增强与聚类场景下的选型建议与可运行示例。 RAG 流水线设计:检索—增强—生成的要点 RAG 把检索到的相关资料塞进提示再让模型作答,缓解幻觉并接入私有知识。本文讲清切分、检索、重排与上下文组装等流水线关键环节。 RAG 实战:从文档切分到重排与评估 手把手讲透检索增强生成(RAG)的完整工程链路:文档解析与切分策略、Embedding 选型、向量检索与混合检索、重排序(Rerank)、上下文压缩,以及用 RAGAS 等指标评估质量与常见失效模式。 RAG 系统评测:从检索质量到生成质量 系统梳理 RAG 的评测维度(召回/精度/忠实度/相关性)与常用指标、工具。
Agent 与工具调用
7 篇 大模型 Agent:从 ReAct 到工具调用与自主规划 深入解析大模型 Agent 的核心范式:ReAct 推理-行动循环、Function Calling 工具调用、规划与记忆机制,以及主流框架定位与局限。 函数调用:让模型调工具 函数调用让大模型以结构化参数调用外部工具与 API。本文讲清工具描述、调用流程与解析要点。 Agent 协议:工具与编排 智能体通过工具调用与编排协议接入外部能力;本文讲清函数调用、工具描述与多步编排的要点。 LLM 工具调用:让模型会调 API 与函数 讲清 function calling 的机制(模型输出调用请求、外部执行、结果回灌),以及设计可靠工具接口的要点。 LLM Agent 架构:感知—规划—行动的闭环 讲清一个 LLM Agent 的基本组成(记忆、规划、工具、执行)与一次任务循环,帮你判断是否需要 Agent。 MCP 进阶实战:自建一个 MCP Server 用官方 SDK 从零实现一个 MCP Server,定义工具原语并接入客户端,讲清传输、鉴权与暴露危险操作的安全注意点。 MCP 协议:模型上下文接入 模型上下文协议(MCP)用统一接口连接大模型与数据源及工具;本文讲清其客户端、服务器与传输层设计。
推理部署优化
7 篇 大模型推理成本优化:从提示缓存到模型路由 系统讲解降低 LLM 调用成本的实用方法,包括提示缓存、模型路由、批量接口、量化与上下文裁剪,并给出可落地的成本测算。 大模型推理优化:降低延迟与显存 系统梳理降低大模型推理延迟与显存占用的手段(批处理/KV 缓存/量化/投机解码/连续批处理)。 模型路由:按任务选模型 模型路由按请求特征把任务分派给合适模型,兼顾效果与成本;本文讲清其原理与方法。 推理框架:vLLM/TGI 对比 vLLM 与 TGI 是高吞吐大模型推理框架;本文对比其调度、量化与适用场景。 推理运行时对比:vLLM、SGLang、TensorRT-LLM 与 llama.cpp 对比主流大模型推理引擎的架构取舍、吞吐与易用性,帮你按场景(云端高并发/本地轻量/量化)选对运行时。 小模型综述:何时用小参数模型以及如何选型 横向对比 Phi、Gemma、Qwen 等小参数模型,讲清数据质量、蒸馏与量化范式,并给出按场景的选型与端侧部署建议。 KV Cache:推理加速核心 KV Cache 缓存已计算的自注意力键与值,避免重复计算,是解码器自回归推理提速与省显存的关键。本文讲清原理与代价。
多模态
2 篇评测与安全
4 篇 大模型护栏:输出合规 护栏在输入与输出两侧约束模型行为,保证合规与安全;本文讲清其层次与落地方式。 大模型水印:给生成文本打上隐形指纹 「在生成阶段用伪随机绿名单偏置采样分布,给 AI 文本打上人类无感、算法可检的隐形指纹,用于内容溯源与滥用识别。」 大语言模型评测基准与方法 系统梳理大语言模型的评测维度、主流学术基准(如 MMLU、GSM8K、HumanEval)、综合框架 HELM、开放式众包竞技场 Chatbot Arena 以及 LLM-as-judge 自动评测方法,并剖析数据污染、基准饱和等常见陷阱。 评测基准:MMLU/HellaSwag MMLU 与 HellaSwag 是衡量大模型能力的常用基准;本文讲清其考察点与使用注意。
没有匹配的教程,换个关键词、难度或主题试试。