中文精炼导读

核心观点

  • Sebastian Raschka 系统综述了"如何控制 LLM 的推理强度"(reasoning effort):推理模型输出的中间推理轨迹让它可以有多档"努力程度",而实现方式在开源社区百花齐放——分离专家、混合 SFT 数据、模式条件化奖励、硬 token 预算或它们的组合。
  • 训练推理模型的核心方法是 RLVR(Reinforcement Learning with Verifiable Rewards,可验证奖励强化学习):在可自动验证的领域(数学用 SymPy/WolframAlpha、代码用编译器/单测)给"0=错、1=对"的奖励;DeepSeek-R1-Zero 证明纯 RLVR 就能让模型学会推理(写出中间解释、回溯、自我纠正——即"Aha 时刻"),无需 SFT。
  • `<think>` 与 `</think>` 标记只是装饰性的、与推理能力无关(不添加也能达到相近基准性能),作用是标记轨迹起止、便于训练管道或 UI 把推理过程与最终答案分离;推理强度则通过系统提示词(如 "Reasoning effort: low/medium/high")或连续数值(如 0.8)传入。
  • 实现强度的两条可能路径:在 RLVR 过程中让不同强度对应不同的长度惩罚(如 Inkling 的奖励公式 R(e) = R_task − λ(e)·N_tokens),或在 RLVR 后做带强度标签的 SFT(如 Qwen3 的 Thinking Mode Fusion);作者推测 gpt-oss / GPT-5.6 很可能结合了两者。
  • 关键权衡:推理强度直接关联 token 消耗与准确率,强度越高准确率越高但收益递减;模型大小与推理强度是两个独立的"旋钮"——较小模型配高推理强度有时能追平较大模型配低强度,最佳组合取决于目标准确率、成本与延迟;"圣杯"是自动强度选择(如 GPT-5 的 Auto 模式,曾因效果不佳被移除)。
推理扩展 vs 训练扩展
推理扩展 vs 训练扩展

内容精讲

文章首先厘清推理模型的定义:在 AI 与 LLM 语境中,推理模型是"输出中间推理轨迹"的模型——像中间响应一样逐步处理问题或任务,而传统模型直接给出答案。训练方面,DeepSeek-R1 提出了用 RLVR 把普通 LLM 训练成推理模型:奖励信号是"0=错误、1=正确",可验证领域是数学(用 SymPy、WolframAlpha 检查)与代码(用编译器、单元测试、LeetCode 等)。值得注意的是,推理轨迹本身不参与训练或模型更新——DeepSeek-R1 论文报告说用中间响应信息训练对模型没有帮助。其他关键论文包括与 DeepSeek-R1 同日(2025 年 1 月 22 日)发表的 Kimi K1.5、"RLVR"术语最早由 Tülu 3(2024 年 11 月)提出;DeepSeek-R1-Zero 证明了纯 RLVR(无需 SFT 阶段)就能让模型学会推理,只是性能弱于完整 R1。仅靠输出奖励训练,模型就能学会写出中间解释、回溯与自我纠正——"Aha 时刻"指的就是模型意识到错误并自我纠正的瞬间。

关于推理扩展(inference scaling),作者列出几种方式:RLVR 训练本身(模型输出更多 token 隐式增加推理计算)、推理强度级别(通过调整输出长度进一步控制)、自洽性(多次查询 + 多数投票,可叠加在推理训练之上)、自精炼(自我验证修正)。典型案例是 DeepSeekMath-V2 在数学推理模型上应用极端推理扩展、在数学奥林匹克难题上达到 SOTA。思考标记方面,`<think>`/`</think>` 只是装饰性标记,与推理能力无关,作用是指出轨迹起止、便于训练管道或 UI 分离;实现方式是在 RLVR 阶段加格式奖励,如 DeepSeek-R1 的 R_total = R_accuracy + R_format。

第一代推理模型(如 DeepSeek-R1)是"专用推理模型"——无论提示词多简单都输出冗长响应、无法关闭推理模式。混合方法(如 Qwen3)则能在普通指令模型与推理模型间按需切换:通过 enable_thinking=True/False 控制,底层 false 相当于在助手响应开头加一个空的 `<think></think>` 段;训练上采用"Thinking Mode Fusion"阶段(SFT),同时训练 `/think` 与 `/no_think` 两种示例;`/think` 与 `/no_think` 是软开关,enable_thinking=False 是强制加空标记的硬开关。

推理强度设置的工作机制是全文核心。GPT-5.6 提供 6 档(Light 到 Ultra),OpenAI 未公开实现细节,但开源 gpt-oss 模型显示强度通过系统提示词控制(如 "Reasoning effort: low/medium/high")。强度的直接效果是 token 使用量与准确率:越高 token 消耗越多、准确率越高,但收益递减——GPT-5.6 Sol 显示过高推理预算变得不经济。两种可能的实现路径:方法一是在 RLVR 过程中让不同系统提示词对应不同长度惩罚(低强度用高长度惩罚);方法二是 RLVR 之后的 SFT 微调(不同强度标签的提示词配对不同推理量的目标响应)。作者推测 gpt-oss 与 GPT-5.6 很可能结合了两种。案例研究 Inkling(Thinking Machine Labs 本周开源)的做法是:在系统消息中指定期望强度、调整每个生成 token 的成本,概念性奖励公式 R(e) = R_task − λ(e)·N_tokens——低强度给更大每 token 成本、鼓励短轨迹,高强度给更小成本、允许更多 token;与 gpt-oss/GPT-5.6 不同的是它用 0 到 1 之间的连续数值(如 "Thinking effort level: 0.8")。

六款开源模型的推理强度方案对比
六款开源模型的推理强度方案对比

文章还对比了训练扩展与推理扩展:GPT-5.6 界面里选 Luna/Terra/Sol 是训练扩展(选不同训练规模产出的模型),调推理强度是推理扩展(固定模型、调推理 token 预算);两者曲线有重叠——较小模型配较高强度有时能追平较大模型配较低强度,所以模型大小与强度是独立旋钮。随后作者逐款拆解六款开源旗舰模型的实现:DeepSeek V4 用"训练分离的强度专家"(Non-think/Think High/Think Max 三种模式,各用独立上下文窗口与长度惩罚、不同 RL 配置,最后经基于策略的蒸馏合并为单一 checkpoint——注意系统指令选择的是训练时创建的行为,把指令加到任意模型不会产生相同效果);Nemotron 3 Ultra 用"学习模式 + 硬预算"(SFT 用 GPT-OSS-120B 生成的 medium-effort 示例、约 2.5% 的 RLVR 提示词用 medium-effort,推理时通过 chat template 控制,预算作为外部停止机制、并在训练时随机截断轨迹让模型学会从未完成推理继续);Kimi K2.5 用"预算与非约束 RL 交替"(Toggle/Token Efficient RL——固定预算会让推理模型过拟合短答案,所以交替跑预算阶段与非约束阶段,效果是 K2 Thinking 上 token 减少 25-30% 而性能几乎不变,且行为能迁移到 GPQA 与 MMLU-Pro);GLM-5 用"回合级与交错思考"(通过多任务 SFT + 更新 chat template 支持交错思考、保留思考、回合级思考三种行为);Qwen3 用"模式融合 + 推理时截断"(四阶段后训练:长思维链 SFT → 推理 RL → Thinking Mode Fusion → 通用 RL,还支持硬推理预算——在请求的阈值处停止推理、插入停止思考指令后继续生成,且该行为据称未经显式训练、在 Fusion 后自发涌现);Inkling 用"连续强度条件化 RL"(0.0-1.0 连续条件化、大部分后训练来自超 3000 万次 rollouts 的异步 RL)。

总结各模型方案可见三个共同组件:SFT + chat template 引入强度模式控制;模式条件化 RL 阶段(上下文窗口与长度惩罚随请求强度变化);显式预算下的鲁棒性提升。作者也坦诚很难判断哪种方法最佳——各模型的基座 checkpoint、训练数据、后训练计算、基准与服务目标各不相同,报告缺少受控比较所需细节;不存在一劳永逸的通用方案,对交互式助手有效的方法可能不适合长期运行的编码代理。未来展望:短期内推理强度仍会是显式模型输入(通常经系统提示词传递),但 agent wrapper/harness 或内部路由器可能越来越多地从任务状态与可用资源自动推断适当的模式与预算(仍允许用户覆盖);"圣杯"是自动强度选择——用廉价模型或路由器根据请求、工具状态、剩余时间或 token 预算自动选择模式,从而优化延迟、成本或最大性能。

阅读价值

适合 LLM 推理模型研究者、API 产品经理与 agent 开发者:这篇文章把"推理强度"从产品概念落到训练机制,系统对比了 DeepSeek V4、Nemotron 3 Ultra、Kimi K2.5、GLM-5、Qwen3、Inkling 六种开源实现(分离专家/预算截断/Toggle/交错思考/模式融合/连续条件化),并提炼出 SFT + 模式条件化 RL + 预算鲁棒性三个共性组件;对想理解"为什么调推理强度会改 token 消耗与准确率"或设计自己的强度控制方案的人,是一份高密度参考。

阅读英文原文 → 返回 AI 技术文档

本文为中文精炼导读,由 AI 基于原文整理,内容与图片版权归原作者所有。原文: https://magazine.sebastianraschka.com/p/controlling-reasoning-effort-in-llms