跳转到正文

17.1 推理模型的兴起

2024 年 9 月 12 日,OpenAI 发布了 o1——第一个被明确称为"reasoning model"的产品级大模型。它在 IOI(国际信息学奥林匹克)、Codeforces、GPQA Diamond、AIME 这些有着明确正确答案的硬任务上的表现,远超同期所有非推理模型。o1 的发布不仅是产品事件,更是一个范式转移的标志:从"模型一次前向给出答案"转向"模型显式思考再给答案"。

10.1.1 o1 → o3 → o4 的演化

证明范式可行

o1 的核心创新不是模型架构——它仍然是 Transformer decoder——而是训练范式的转变。OpenAI 在官方博客中明确说:o1 使用 RL 来"强化模型的思考链"。模型在训练时被鼓励生成长 CoT,然后基于答案是否正确获得奖励。这与传统 RLHF 用人类偏好作为奖励不同,o1 的奖励是任务结果本身——答对就给分,答错就不给分。

o1 在发布时有几个具体表现让整个行业震动:

  • AIME 2024:从 GPT-4o 的约 12% 跃升到 o1 的 83%(pass@1,单次采样)
  • Codeforces:o1 的 rating 达到 1673,相当于人类选手 top 10%
  • GPQA Diamond:78%(PhD 级科学问答),远超 GPT-4o 的 53%

但 o1 也有一个让用户不满的工程选择:它的 CoT 是隐藏的。用户只看到最终答案,看不到推理过程。OpenAI 给出的理由是"安全、合规、防止用户蒸馏模型",但这个决定让 o1 的可信度受到质疑——如果一个推理模型不能解释自己的推理,用户怎么知道它不是在胡说?

在 ARC-AGI 上首次突破

2024 年 12 月,OpenAI 在"12 Days of OpenAI"活动上发布了 o3(注意:跳过了 o2 这个编号)。o3 的关键突破是:

  • ARC-AGI-2:o3 是第一个在 ARC-AGI-2 上达到 75% 以上的模型(GPT-4o 只有约 5%)
  • SWE-bench Verified:71.7%(软件工程基准)
  • Codeforces rating:2727(人类 top 0.1% 水平)

o3 还引入了一个工程参数:推理努力(reasoning effort)——用户可以在 API 里指定 reasoning_effort(low/medium/high),控制模型花多少 token 在思考上。这是后来"思考预算"功能的原型。

推理能力向工具调用扩展

2025 年 4 月,OpenAI 发布了 o4-mini 和完整的 o3 升级版(社区有时称为 o4)。o4 的最大特点是推理能力与工具调用结合

  • 模型在推理过程中可以主动调用工具(搜索、代码执行、图像分析)
  • 工具调用的结果反过来影响下一步推理
  • 形成"思考 → 调工具 → 再思考 → 再调工具"的循环

这种范式后来被定义为 agentic reasoning——推理不再是单次前向的 CoT,而是与外部环境交互的多步过程。这与 第 10 章 Agentic RL 的内容深度交叉。

10.1.2 Competitive Programming 论文 与 涌现的关键证据

o1 发布后,社区最大的疑问是:OpenAI 是怎么训练出这种推理能力的? 是不是依赖了大量人工标注的 CoT 数据?

2025 年 2 月,OpenAI 发表了一篇关键论文——Competitive Programming with Large Reasoning Models(arXiv:2502.06807)。这篇论文没有公开训练细节,但提供了三个关键发现:

端到端 RL 优于特定领域流水线

传统上,Codeforces 这类竞赛任务的 SOTA 流水线是:

text
问题 → 编译器 + 测试用例生成 → 程序合成 → 选择最优解

这个流水线里的每一步都是专门设计的(特定领域的搜索算法、特定的程序合成器)。OpenAI 发现:o1 / o3 这种端到端 RL 训练的通用推理模型,在 Codeforces 上打败了这些专用流水线

这个结果挑战了"特定任务用特定方法"的常识。它的含义是:通用推理能力可以超越专门优化——只要 RL 训练足够充分。

复杂测试时推理从 RL 自然涌现

论文报告了一个让社区震惊的观察:o1 / o3 在做 Codeforces 题目时,会展现出复杂的多阶段推理,包括:

  • 生成多个候选解:模型自己生成多个解法,比较优劣
  • 执行验证:用工具执行代码,看结果是否符合预期
  • 自我修正:发现错误后重新推导
  • 策略切换:从贪心算法切换到动态规划,再切换到回溯

这些行为不是人工设计的——OpenAI 没有在训练数据里显式标注"先尝试贪心,再尝试 DP"。它们是从 RL 训练中自然涌现的。

这个发现的意义是:只要奖励信号足够清晰(答对就给分),RL 就能让模型自己学会复杂的解题策略。这与 R1-Zero 的"aha moment"是完全一致的——涌现行为不是偶然,而是 RL 训练的内在特性。

Test-time Compute 与 Train-time Compute 的权衡

论文还报告了一个关键 trade-off:

  • 增加训练算力:模型的基础能力提升,但每道题的推理 token 数基本不变
  • 增加推理算力(让模型思考更久):在固定训练算力下,可以进一步提升表现

这个发现是 Test-time Compute Scaling 的核心论点——下一节我们会展开讨论。

10.1.3 推理能力 与 涌现 vs 激活

o1 和 R1-Zero 都报告了"推理行为涌现"的现象。但严格来说,"涌现"这个词有两层含义需要区分:

含义一:推理行为从未在训练数据中显式出现

R1-Zero 没有见过任何人工标注的 CoT,但训练后会自主生成长思维链、做反思、做验证。这种"涌现"是相对于训练数据而言的——模型没有被教过这样做。

含义二:推理能力是 RL 阶段"从零创造"的

这一层含义不成立。后续研究(如 SimpleRL-Zoo、Open-R1)发现:base model 已经具备潜在的推理能力——只要给它一个清晰的任务和足够的采样次数,它就能给出正确的推理过程。RL 做的不是"从零创造推理",而是"激活并强化已存在的推理能力"。

这个区分对实践很重要:

  • 如果你认为推理能力是 RL 创造的,你会投入大量算力做大规模 RL 训练
  • 如果你认为推理能力是 RL 激活的,你会先检查 base model 的潜在能力上限——可能少量 RL + 好的 base model 就能接近 SOTA

DeepSeek 团队后来在 R1 论文里也明确说:"推理能力主要是预训练阶段赋予的,RL 只是把它组织起来"。这个观点现在已经是行业共识。

10.1.4 推理模型的工业格局

到 2026 年中,推理模型已经成为工业级产品,主要玩家:

模型厂商关键特点
o1 / o3 / o4OpenAIHidden CoT、reasoning_effort 参数
DeepSeek-R1 / V3.2 SpecialeDeepSeekVisible CoT、纯 RL 路线、开源
Claude Opus 4.6 / 4.7Anthropic自适应思考、Extended Thinking API
Gemini 3 Pro Deep ThinkGoogle并行推理"思考层"、长上下文
Qwen3 Thinking 系列AlibabaHybrid Thinking、Thinking Budget
Kimi k1.5 / K2.5Moonshotlong2short RL、Thinking Budget
GLM-Zero / GLM-4.6Zhipu推理 + 工具调用
MiniMax M1MiniMaxCISPO + Lightning Attention

注意一个关键区别:

  • Hidden CoT 路线:OpenAI o 系列。模型思考,但不展示思考过程。优势:用户看不到思考,无法蒸馏;劣势:可解释性差,用户信任度低。
  • Visible CoT 路线:DeepSeek、Qwen、Kimi、Anthropic、Google。模型思考并展示思考过程。优势:可解释、可微调;劣势:用户可以复制 CoT 数据。

这个分歧不只是产品策略,还涉及对齐与安全的深层问题——10.5 节会展开。

10.1.5 一个关键概念 与 推理 token

传统 LLM 输出只有一个 token 序列:<答案 token>。推理模型输出多了一个"推理 token"段:<推理 token> <分隔符> <答案 token>

在工程实现上,这通常通过特殊 token 实现:

text
<|begin_of_thought|>
用户的问题是要解决...让我先理解题意...
可以尝试的方法有...
第一种:... 这种方法的问题在于...
第二种:... 这种方法看起来可行...
让我验证一下...
是的,第二种方法得到正确结果。
<|end_of_thought|>
<|begin_of_solution|>
最终答案是 X。
<|end_of_solution|>

这个结构让训练阶段可以分别给"推理部分"和"答案部分"打分——这是 Hybrid Thinking、思考预算、long2short 这些技术的基础。

小结

推理模型的兴起不是一个孤立事件,而是 2024-2025 年 LLM 训练范式转移的集中体现。o1 证明了"RL 可以塑造推理行为",R1-Zero 证明了"纯 RL 不需要 SFT 冷启动",Competitive Programming 论文证明了"复杂推理策略从端到端 RL 自然涌现"。

但这些发现引出了一个更深层的问题:如果推理能力主要来自预训练,为什么推理模型比传统 LLM 强这么多? 答案在下一节——test-time compute scaling 改变了"算力花在哪里"的分配。

现代强化学习实战课程

个人非商业离线镜像 · 内容版权归 WalkingLabs 所有,依 CC BY-NC-SA 4.0 授权 · 查看原文