推理模型与测试时计算:让模型慢思考
从快思考到慢思考
传统大语言模型(LLM)在收到问题后几乎立刻给出答案,类似认知科学中卡尼曼描述的「系统一」快思考:直觉、低延迟,但面对多步推理容易出错。推理模型则切换为「系统二」慢思考——在输出最终答案前,先生成一段冗长、通常对用户不可见的内部推理过程,并进行自我检查与纠错。
这种范式的核心主张是:推理质量可以通过在推理阶段投入更多计算来提升,即「思考得越久越准」。它构成了继预训练缩放(Kaplan 等,2020)之后的又一条能力缩放轴——测试时计算(test-time compute)。
思维链 CoT 基础
慢思考最早的可复现基础是思维链(Chain-of-Thought, CoT)提示。Wei 等人在论文《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》(arXiv:2201.11903,2022)中发现:只要在提示中给出「逐步推理」的示例,模型就会模仿着写出中间步骤,其复杂推理能力在足够大的模型上自然涌现。配合 540B 参数的 PaLM,CoT 在小学数学应用题基准 GSM8K 上达到 58.1% 的准确率。
CoT 有少样本(提供示例)与零样本(仅加一句「让我们一步步思考」)两种形态。下面是一段零样本 CoT 提示示意:
问题:一个球和球拍共 1.10 元,球拍比球贵 1 元,球多少钱?
请一步步思考:
设球的价格为 x 元,则球拍为 x+1 元。
两者合计 x + (x+1) = 2x + 1 = 1.10。
解得 2x = 0.10,x = 0.05。
答案:球 0.05 元。
CoT 本质是给模型一块「草稿纸」,让逐步计算成为后续答案的上下文。
推理模型的训练范式(RL+PRM)
提示式 CoT 效果不稳定,模型并不知道何时该「认真想」。真正把慢思考训进模型的是大规模强化学习(RL)。OpenAI 在 2024 年 9 月的博客《Learning to reason with LLMs》中介绍 o1:其大规模 RL 算法教会模型用思维链「高效地产出想法」,并让模型学会识别并纠正错误、把难题拆成子问题、在一条路走不通时换策略。OpenAI 观察到,o1 的性能随训练时 RL 算力与测试时思考时间同步提升。
这里的关键技术之一是过程奖励模型(PRM)。OpenAI 论文《Let’s Verify Step by Step》(arXiv:2305.20050,Lightman 等)系统比较了两种监督:结果监督(只看最终答案对错)与过程监督(对每一步中间推理打分)。结论明确:过程监督显著更优,PRM 在 MATH 测试子集上以 Best-of-N 达到 78.2% 的解题率,并发布含 80 万步级标注的数据集 PRM800K。PRM 能精确定位逻辑出错的那一步,是测试时搜索与 RL 的「验证器」核心。
代表模型 o1 与 DeepSeek-R1
OpenAI o1(2024 年 9 月)是首个把「长思维链 + RL」产品化的模型:在 AIME 数学竞赛、Codeforces 编程、GPQA 博士级科学问答上大幅超越 GPT-4o,表现随思考预算单调提升。
DeepSeek-R1(arXiv:2501.12948,2025 年 1 月)是开源推理模型的分水岭。其先行版本 DeepSeek-R1-Zero 直接对基座模型做大规模 RL(采用 GRPO 算法、规则式可验证奖励),无需监督微调冷启动,便自发涌现出反思、验证、长链推理等行为;R1 再补入冷启动数据与多阶段训练管线,性能对齐 o1-1217 级别。论文报告 AIME 2024 pass@1 达 79.8%、MATH-500 达 97.3%,并以 MIT 协议开源权重,还蒸馏出 1.5B 至 70B 的多个小模型,证明推理能力可迁移。
测试时计算的 scaling 规律
Snell 等人 2024 年的论文《Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters》(arXiv:2408.03314)刻画了测试时计算的缩放规律。他们分析两类机制:用稠密的过程奖励模型做搜索(PRM 引导的搜索),以及根据提示自适应地修订模型自身的回答分布。结论是:不同方法的有效性强烈依赖问题难度,因此应按难度「计算最优」地分配测试时算力——相比朴素的 Best-of-N,该策略将测试时计算效率提升 4 倍以上;在 FLOPs 匹配下,对基座模型已有一定成功率的问题,测试时计算可击败大 14 倍的模型。这从经验上证明:对某些难题,「想得更久」比「参数更多」更高效。
适用与不适用场景
推理模型在答案可验证、需要多步推演的任务上收益最大:数学竞赛与证明、代码生成与调试、复杂规划、科学推理。此类任务有明确对错信号,PRM 与 RL 才能发挥作用。
它并不适合所有场景。简单事实检索、闲聊、创意写作等任务无需长链推理,强加 CoT 只会拖慢延迟、增加成本。慢思考的代价是更高的推理时延与算力开销,因此在低延迟、高并发或对可解释性无要求的场景,标准快思考模型仍是更经济的选择。
小结
推理模型把「测试时计算」变成新的能力杠杆:从 CoT 提示,到以 RL+PRM 训练出的 o1 与 DeepSeek-R1,再到 arXiv:2408.03314 揭示的计算最优缩放规律,慢思考在数学、代码、复杂规划上显著优于快思考。代价是延迟与成本,故应按任务难度与可验证性取舍使用。
参考与延伸阅读
- Wei, J. 等(2022),Chain-of-Thought Prompting Elicits Reasoning in Large Language Models,arXiv:2201.11903。https://arxiv.org/abs/2201.11903
- OpenAI(2024-09-12),Learning to reason with LLMs(o1 技术博客)。https://openai.com/index/learning-to-reason-with-llms/
- Lightman, H. 等(2023),Let’s Verify Step by Step(PRM800K 过程奖励),arXiv:2305.20050。https://arxiv.org/abs/2305.20050
- Snell, C., Lee, J., Xu, K., Kumar, A.(2024),Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters,arXiv:2408.03314。https://arxiv.org/abs/2408.03314
- DeepSeek-AI(2025-01-22),DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning,arXiv:2501.12948。https://arxiv.org/abs/2501.12948