小模型综述:何时用小参数模型以及如何选型

大模型(LLM)能力很强,但并非所有场景都需要几十亿、上千亿参数。把模型塞进手机、放进内网、压低每次调用的成本,正是「小模型」(Small Language Model,SLM)的用武之地。本文先说清为什么关注小模型,再横向对比主流小模型家族,拆解它们的训练范式,给出按场景的选型建议,最后用一个可运行的 3B 量化模型示例收尾。

为什么关注小模型

所谓小模型,通常指参数量在数十亿(B)及以下、可以跑在单张消费级显卡、笔记本电脑、手机甚至嵌入式芯片上的语言模型。与大模型相比,它们解决的是一类非常实际的工程问题。

端侧与边缘部署。手机、车机、IoT 设备往往没有稳定高速的网络,也不该把用户数据传到云端。小模型可以常驻本地,离线可用,数据不出设备。

私有化与合规。金融、医疗、政企内网常有数据不出域的硬性要求。把模型部署在自有服务器,比调用公有云 API 更可控。

低延迟。少了网络往返,本地推理的响应时间通常可以压到几百毫秒级,适合实时交互、语音助手、键盘输入补全等场景。

低成本。大模型每次推理的算力与显存开销高,按调用量计费时账单可观。小模型单卡即可支撑较高并发,单位 token 成本显著更低。

当然,小模型的代价是能力上限更低。所以核心问题不是「小模型能不能取代大模型」,而是「在哪些任务上,小模型已经够用,从而把成本与延迟打下来」。

主流小模型家族横向对比

下面把几个有代表性、且公开论文或权重可查的小模型家族放在一起对比。带「待核实」标注的规格,本稿未在核验论文中取得确证,请以后续官方发布为准。

家族代表尺寸数据 / 训练特点上下文说明
Microsoft Phiphi-1(1.3B)、phi-2(2.7B,待核实)、phi-3-mini(3.8B)强调「教科书质量」数据,配合合成数据;phi-3 还在 phi-2 数据基础上扩大为 3.3T tokenphi-3 默认 4K,并提供 128K 长上下文版本(待核实)phi-1 为代码模型;phi-3-mini 在 MMLU 上约 69%(已核验)
Google Gemma原始 Gemma 2B / 7B;Gemma 2 含 2B / 9B(待核实)基于 Gemini 研究与技术构建,提供预训练与指令微调权重待核实原始 Gemma 在 18 项文本任务中 11 项超过同尺寸开源模型(已核验)
Qwen 小尺寸原版含 1.8B / 7B / 14B / 72B(待核实);后续 Qwen2 / Qwen2.5 提供 0.5B / 1.5B / 3B(待核实)基础预训练 + RLHF 对齐的 Qwen-Chat,具备工具调用与规划能力待核实小尺寸覆盖广,是端侧与内网的常选项
Llama 小尺寸Llama 3.2 提供 1B / 3B(待核实);Llama 3.1 最小为 8B通用预训练 + 指令微调待核实生态成熟,工具链完善
StableLM / Mistral 小尺寸Mistral 最小为 7B(待核实);StableLM 系列含 3B 等(待核实)通用预训练待核实Mistral 7B 长期是「最小可用 baseline」之一
Apple OpenELM270M 至 3B(待核实)开放高效语言模型,强调逐层缩放与公开训练数据待核实偏研究与端侧参考实现

下面挑几个已经用论文核验过的重点说清楚。

Microsoft Phi 系列。Phi 系列的核心主张是「数据质量比数据规模更重要」。phi-1 来自论文《Textbooks Are All You Need》(arXiv:2306.11644,已核验):它是一个 1.3B 的 Transformer 代码模型,训练数据由两部分组成,一部分是从网上筛选出的「教科书质量」(textbook quality)数据约 6B token,另一部分是用 GPT-3.5 合成生成的教科书与习题约 1B token。尽管规模很小,phi-1 在 HumanEval 上达到 50.6% 的 pass@1,在 MBPP 上达到 55.5%。后续 phi-3-mini(arXiv:2404.14219,已核验)把思路扩展到通用语言模型:3.8B 参数、训练 3.3T token,在 MMLU 上约 69%、在 MT-bench 上约 8.38,论文称其整体表现可媲美 Mixtral 8x7B 与 GPT-3.5,且小到能部署在手机上。同系列的 phi-3-small(7B)与 phi-3-medium(14B)在 MMLU 上分别约 75% 与 78%(已核验)。

Google Gemma 系列。Gemma(arXiv:2403.08295,已核验)是 Google 基于 Gemini 研究与技术构建的轻量开源模型家族,首发提供 2B 与 7B 两种尺寸,并同时放出预训练与指令微调权重。论文报告其在 18 项文本任务中有 11 项超过同尺寸开源模型。后续 Gemma 2 增加了 9B 尺寸(待核实,本稿核验的是原始 Gemma 报告)。

Qwen 小尺寸。Qwen 技术报告(arXiv:2309.16609,已核验)介绍了该系列的基础预训练模型与经过 RLHF 对齐的 Qwen-Chat,并强调其工具调用与规划能力。原版报告未逐项列出全部尺寸;业界常见的原版 Qwen 含 1.8B / 7B / 14B / 72B(待核实)。面向端侧的小尺寸 0.5B / 1.5B / 3B 主要来自后续的 Qwen2 与 Qwen2.5(待核实,不在本次核验的报告范围内),是内网与边缘部署的热门选择。

其余家族(Llama、StableLM、Mistral、Apple OpenELM)的具体参数规格本稿未逐一核验,请在选型前以官方权重卡或技术报告为准。

训练范式:数据质量优先、蒸馏与量化

小模型之所以「小而不弱」,背后是三种互补的范式。

数据质量优先。Phi 系列的「教科书质量」路线说明:与其堆海量噪声网页,不如用经过筛选与合成的高质量数据。phi-1 仅用约 7B token 的精选加合成数据,就让 1.3B 模型在代码任务上超过体量大得多的模型。这给小模型训练一个直接启示:在小参数容量下,噪声数据会迅速拉低上限,而「少而精」的数据更易被小模型学扎实。

蒸馏(从大模型到小模型)。蒸馏让小模型(学生)去模仿大模型(教师)的输出分布,而不是直接从零学硬标签。常见做法是教师给出带温度的软标签,学生用 KL 散度对齐。关于原理、温度 softmax 与 DistilBERT 实例,可参考站内《模型蒸馏:把大模型的知识压进小模型》一文。蒸馏改变的是「模型本身更小」,是造小模型的主要训练手段。

量化后部署。量化不改变网络结构,而是把权重与激活从 FP16 等高精度压到 INT8、INT4 等低位宽,降低显存与存储、提升吞吐。常见形式是训练后量化(PTQ),模型导出为 GGUF 等格式后用 llama.cpp、Ollama 等运行时加载。量化是「把已有模型搬上边缘设备」的最后一环,与蒸馏互补:蒸馏造小模型,量化压比特,二者叠加是端侧落地的常用路径。

选型建议:按场景给尺寸与量化

选小模型没有银弹,先看场景,再定尺寸与量化档位。

手机端 / 嵌入式。优先 ≤3B 的模型,并做 INT4 量化。例如 phi-3-mini(3.8B)的 q4 版本、Qwen2.5-3B 的 q4 版本、Gemma-2B 的 q4 版本。目标是在有限内存下跑得动、延迟低。注意:3.8B 严格超过 3B,但经 q4 量化后体积约 2.x GB,仍属手机可承载范围(具体内存占用待核实)。

内网 / 私有化。3B 至 7B、q4 或 q5 量化通常够用。这个区间能处理更完整的问答、摘要、抽取等任务,同时数据全程不出域。若任务偏专业领域,建议配合检索增强(RAG)弥补小模型的世界知识短板。

高并发服务端。若以吞吐为第一目标,可用 7B 至 14B、q4/q5 量化,配合 GPU 批处理;若单请求延迟敏感且任务同质,也可多实例部署小模型并行。成本敏感时,先压尺寸再压量化档位,逐级实测延迟与质量。

小模型的真实能力边界。需要坦诚看待:在长上下文理解、复杂多步推理、开放域知识广度、强规划与工具链编排上,小模型明显弱于大模型。它们最适合「目标明确、输入封闭、可预期输出」的垂直任务,例如固定模板的抽取、分类、短文本改写、设备端指令理解;不适合充当开放问答或重推理的总控大脑。选型的正确姿态是「用大模型定义能力上限,用小模型承接可被降本的确定性任务」。

落地示例:用 Ollama 与 llama.cpp 跑 3B 量化模型

下面以 Qwen2.5-3B 的量化版本为例(模型名以官方实际发布为准,具体标签待核实),给出两条可直接跑通的路径。

使用 Ollama 命令行。先拉取模型,再进入交互:

# 拉取 3B 量级量化模型
ollama pull qwen2.5:3b

# 进入交互式对话
ollama run qwen2.5:3b

用 Python 调用 Ollama:

import ollama

# 调用本地 3B 量化模型完成一次问答
resp = ollama.chat(
    model="qwen2.5:3b",
    messages=[{"role": "user", "content": "用一句话解释什么是模型量化。"}],
)
print(resp["message"]["content"])

使用 llama.cpp 直接跑 GGUF。先准备一个已量化好的 GGUF 文件(文件名以社区发布为准,待核实),再用命令行推理:

# 假设已下载 qwen2.5-3b-instruct-q4_k_m.gguf
./llama-cli -m qwen2.5-3b-instruct-q4_k_m.gguf \
  -p "用一句话解释什么是模型量化。" \
  -n 128

两条路径的本质相同:模型已经过 INT4 量化、以 GGUF 等格式存储,运行时由 llama.cpp 内核加载。Ollama 在 llama.cpp 之上做了模型管理与 API 封装,适合快速上手;llama.cpp 命令行则更适合做参数微调与性能基准测试。

小结

小模型解决的是端侧、私有化、低延迟、低成本这四类工程问题,而非全面取代大模型。Phi 系列用「教科书质量」加合成数据证明小参数也能有强能力,Gemma 与 Qwen 的小尺寸则提供了成熟可部署的权重。训练上,数据质量优先、蒸馏造小模型、量化压比特三者互补;选型上,按手机端、内网、高并发分别取 ≤3B、3B 至 7B、7B 至 14B 并配合 INT4/INT8 量化。记住小模型的真实边界:它最适合确定性的垂直任务,复杂推理仍应交给大模型。

参考与延伸阅读

  • Gunasekar S. 等. Textbooks Are All You Need. 2023. arXiv:2306.11644. https://arxiv.org/abs/2306.11644 (已核验:phi-1 为 1.3B 代码模型,教科书质量数据约 6B token 加合成约 1B token,HumanEval 50.6%)
  • Abdin M. 等. Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone. 2024. arXiv:2404.14219. https://arxiv.org/abs/2404.14219 (已核验:phi-3-mini 3.8B / 3.3T token / MMLU 约 69%;phi-3-small 7B / 75%;phi-3-medium 14B / 78%)
  • Gemma Team. Gemma: Open Models Based on Gemini Research and Technology. 2024. arXiv:2403.08295. https://arxiv.org/abs/2403.08295 (已核验:首发 2B 与 7B,提供预训练与指令微调权重,18 项文本任务中 11 项超过同尺寸开源模型)
  • Bai J. 等. Qwen Technical Report. 2023. arXiv:2309.16609. https://arxiv.org/abs/2309.16609 (已核验:系列含基础预训练与 RLHF 对齐的 Qwen-Chat;具体尺寸列表待核实)
  • 站内教程:模型蒸馏:把大模型的知识压进小模型(蒸馏原理与 DistilBERT 实例)
  • 说明:Gemma 2 的 9B、Qwen 的 0.5B/1.5B/3B、Llama 3.2 的 1B/3B、Mistral 7B、Apple OpenELM 270M 至 3B 等具体规格,本稿未逐一核验,请在落地前以官方技术报告或权重卡为准(待核实)
本文累计阅读