核心观点

内容精讲

OpenAI 发布 o1 距今已近两年,它把「基于 LLM 的推理模型」这一概念带火;四个月后 DeepSeek-R1 公布用 RLVR 训练推理模型的完整配方。到 2026 年中,推理模型已经成为新模型发布的标准配置——GPT-5.6 家族每个尺寸都带有约 5-6 个推理强度档位。问题随之而来:一个模型如何学会在不同强度档位下工作?

**先厘清术语。** 与所有 ML 术语一样,「推理模型」不该被字面理解——它不意味着模型像人类那样推理。在 AI 与 LLM 研究语境里,推理模型指「输出中间推理轨迹」的模型:把问题逐步拆解、写出中间推理过程,再给出最终答案。直观对比就是:普通 LLM 直接给答案,推理模型先给一段「思考过程」再给答案。

**两条提升路径。** 改善(推理)任务表现本质上只有两条路:训练缩放与推理缩放。训练缩放把模型本身变强;推理缩放则是在测试时投入更多计算(更多中间步骤、更多候选答案的验证与搜索)。RLVR 是训练侧的代表性技术:为可验证的数据域提供奖励信号(0=错误,1=正确)——数学域用符号检查器(SymPy、WolframAlpha)验证,代码域用编译器或单元测试验证。值得注意的是,DeepSeek-R1 训练中推理轨迹本身不参与模型更新:虽然尝试过把中间推理信息用于训练,但论文报告它没有帮助,最终只依据最终答案与回答格式给出奖励。(如何通过过程奖励模型把中间轨迹纳入训练信号,是当前活跃的研究方向。)

**aha 时刻:纯奖励也能催生推理。** 只靠输出奖励训练就足以让模型学会「推理」:写出中间解释、发现问题、回溯、自我纠错。模型意识到自己犯错并自行纠正的时刻就是「aha 时刻」。这里有一层常被忽略的谱系:Kimi K1.5 与 DeepSeek-R1 同一天(2025 年 1 月 22 日)发布在 arXiv,而 RLVR 这个术语早在两个月前的 Tülu 3 论文里就已出现。DeepSeek-R1 之所以最出圈,是因为它的 R1-Zero 变体证明了:纯 RLVR 直接作用在预训练基座上(无监督微调)也能产生推理行为——R1-Zero 比完整 R1 弱,但证明了推理能力可以「纯 RL 出来」。

**从单档到多档:控制推理强度。** 现实产品需要的不是单一强度的推理模型,而是一个模型能在「快速回答」与「深思熟虑」之间切换。多档推理强度正是推理缩放轴上的产品化设计:同一模型在低档位花较少 token 快速作答,高档位生成更长推理轨迹、更仔细地自我验证。GPT-5.6 的三尺寸 × 约 5-6 档的组合,把「推理预算」做成了用户可调旋钮。这背后的工程问题是:如何训练模型在强度档位之间平滑切换,而不是退化成两个不同模型。

**本质判断。** 推理模型不是新的模型类型,而是「在推理缩放这条轴上做了优化与产品化」的 LLM。理解这一点,就能看懂 2026 年几乎所有模型发布中的核心变量:训练缩放决定模型能力的上限,推理缩放决定同一模型在不同成本预算下的表现曲线,而多档强度设计决定用户能以多细的粒度在这条曲线上做取舍。

阅读价值

对 LLM 研究与训练工程师,这是一份「推理模型技术地图」:RLVR 机制、aha 时刻的来源、R1/K1.5/Tülu3 的谱系关系都讲透了;对产品与技术决策者,多档推理强度的设计逻辑直接对应「如何用推理缩放控制成本」这一 2026 年的核心议题。

阅读原文 → 返回 AI 技术文档

内容与图片版权归原作者所有 · 原文: https://magazine.sebastianraschka.com/p/controlling-reasoning-effort-in-llms