Reed's News
← 返回精选

控制LLM中的推理努力

AI 68 Sebastian Raschka, PhD 2026/7/18 5353 字 原文 ↗

大语言模型如何学习低、中、高推理强度模式

OpenAI推出o1模型,让基于大语言模型(LLM)的推理模型概念普及开来,至今已近两年。约四个月后,深度求索(DeepSeek)发布了DeepSeek-R1模型,同时公开了一套用于训练这类推理模型的**可验证奖励强化学习(RLVR)**方案。

上周,OpenAI推出GPT-5.6模型家族,包含三种尺寸,每种尺寸又提供五到六种不同的推理强度选项。

显然,推理模型已成为行业标配,是现代大模型发布时的核心组成部分。

此前,我曾介绍过推理模型的方法论(《理解推理大语言模型》https://www.google.com/url?q=https://magazine.sebastianraschka.com/p/understanding-reasoning-llms&sa=D&source=editors&ust=1784335866721316&usg=AOvVaw3KNY841B7H7EqshVnEJp8D),也梳理过相关研究论文(《大语言模型推理强化学习现状》https://www.google.com/url?q=https://magazine.sebastianraschka.com/p/the-state-of-llm-reasoning-model-training&sa=D&source=editors&ust=1784335866721667&usg=AOvVaw1WaEOS_3zXEmP9JnLDSoZK、《大语言模型推理模型推理阶段技术现状》https://www.google.com/url?q=https://magazine.sebastianraschka.com/p/state-of-llm-reasoning-and-inference-scaling&sa=D&source=editors&ust=1784335866721813&usg=AOvVaw2nWsugtg_XcMLKTUGcnk7B),甚至撰写了一本440页的专著《从零开始构建推理模型》https://www.google.com/url?q=https://sebastianraschka.com/books/%23build-a-reasoning-model-from-scratch&sa=D&source=editors&ust=1784335866721991&usg=AOvVaw1JZMrDei_qWFsW_OMMNnyL,详解推理模型的开发流程。

《从零开始构建推理模型》https://www.google.com/url?q=https://sebastianraschka.com/books/%23build-a-reasoning-model-from-scratch&sa=D&source=editors&ust=1784335866722209&usg=AOvVaw3vLZKXLH-7-a4O6sFgRYh0——彩色印刷版!

这些内容聚焦于如何将传统大语言模型转化为推理模型。而本文将重点讲解,如何开发像开篇图中那样支持多推理强度模式的推理模型。

无需担心,本文可独立阅读,但上述资源也能为你补充更多背景知识。

1. 推理模型的简要定义

谈及机器学习或AI技术,有一点需要注意:我们通常不应从字面意义理解技术术语。例如,机器学习和AI中的(人工)神经网络,并非真正像人类大脑这样的生物神经网络那样运作。

同理,提到“推理模型”时,我们不能期望它真的像人类一样思考推理。在AI和大语言模型研究语境中,“推理模型”指的是能输出中间推理轨迹的模型——即针对问题或任务,逐步推导的中间过程。

用例子解释最为直观:

2. 推理模型的训练与推理缩放概述

提升推理任务性能主要有两种途径:训练缩放推理缩放

《大语言模型推理能力习得》https://openai.com/index/learning-to-reason-with-llms/

我们先简要介绍训练层面的方法。

2.1 推理模型的训练

简言之,DeepSeek-R1https://arxiv.org/abs/2501.12948提出采用可验证奖励强化学习(RLVR)训练大语言模型,将其转化为推理模型。RLVR是一种针对可验证数据领域提供奖励信号(`0=错误`、`1=正确`)的技术。这里的可验证数据领域包括:

  • 数学:可用SymPy或WolframAlpha等符号数学工具验证结果
  • 代码:可通过编译器、单元测试或LeetCode等集成平台验证正确性

值得注意的是,推理轨迹本身并未用于模型训练或更新。尽管研究人员尝试将这一中间过程信息纳入训练,但DeepSeek-R1论文指出,这对模型训练并无帮助,最终未被采用。(如何通过过程奖励模型将中间推理轨迹纳入训练信号,仍是当前活跃的研究方向。)

2.2 “顿悟”时刻

不过,如图7所示,仅基于输出结果的奖励进行训练,就足以让模型学会如何逐步推导问题——它会自动生成中间解释、回溯思考并自我修正。模型意识到错误并自我修正的时刻,被称为“顿悟”(Aha)时刻。

顺带一提,虽然DeepSeek-R1是知名度更高的论文,也让可验证奖励强化学习和推理模型开发受到广泛关注,但在arXiv上,还有一篇名为《Kimi K1.5》https://arxiv.org/abs/2501.12599的论文与它在同一天(2025年1月22日)发布。此外,RLVR这一术语早在两个月前,就已出现在论文《Tülu 3:推进开源语言模型后训练的边界》https://arxiv.org/abs/2411.15124中。

DeepSeek-R1更受欢迎的原因之一,是它证明了仅通过纯强化学习(RL)就能让模型产生推理行为。

例如,Tülu 3和Kimi K1.5是在监督微调(SFT)模型的基础上应用强化学习;而DeepSeek-R1虽同样基于DeepSeek-V3基础模型的SFT checkpoint训练,但还推出了纯RLVR训练的变体DeepSeek-R1-Zero。尽管R1-Zero的性能弱于R1,但它证明了RLVR足以教会模型生成并利用推理轨迹。

R1-Zero更多是概念验证模型,而完整的DeepSeek-R1推理模型训练流程通常是多阶段的,如前文所述,会更复杂一些。

《理解推理大语言模型》https://magazine.sebastianraschka.com/p/understanding-reasoning-llms

顺带一提,如今大多数大语言模型本质上都是推理模型,意味着它们都采用了类似DeepSeek-R1的RLVR训练方式。

2.3 推理缩放简介

除了通过训练提升推理能力,另一种提升模型性能的手段是推理阶段算力缩放。简言之,就是在模型训练完成后、实际使用时,投入更多算力以获得更优结果。

这本身是一个独立的主题,你可以阅读我的文章《大语言模型推理模型推理阶段技术现状》了解详细内容:

大语言模型推理强化学习现状

下面我将总结其中最核心的背景信息:

首先,用RLVR训练模型本身就隐含了一种推理缩放——推理模型在推理阶段输出的token数量通常多于传统大语言模型,这意味着推理时需要消耗更多算力。

其次,我们可以通过推理强度等级进一步调整输出长度,这一点稍后详述。

第三,还有许多其他推理缩放技术,其中一种常用方法是自一致性,通常以“多数投票”的形式实现:多次向模型发起查询,最终答案由多数结果决定。

这种方法既适用于传统大语言模型,也适用于推理模型,可按需使用,作为推理训练的补充。DeepSeekMath-V2就是一个典型例子:研究人员在面向数学的推理模型基础上,采用极致的推理缩放技术,在高难度奥数类问题上实现了最先进的性能。

《DeepSeekMath-V2:迈向可自我验证的数学推理》https://arxiv.org/abs/2511.22570

同样,关于其他技术的概述,我建议参考另一篇文章《大语言模型推理模型推理阶段技术现状》:

大语言模型推理模型推理阶段技术现状

3. 思考标记(Think Tokens)

你可能在之前的“顿悟时刻”图中看到过<think></think>标记。我把对应的图放在下面,方便你查看:

这些<think></think>标记对推理能力而言只是“装饰性”的。它们不会赋予模型推理能力,也不是实现良好推理性能的必需条件。即使不使用这些分隔符训练模型,也可能达到相近的基准测试性能。

<think>标记的主要作用是标记推理轨迹的起始和结束,让训练流程或用户界面能将其与最终答案区分开,并可选择对用户隐藏(ChatGPT或Codex等界面通常会这么做)。

关键在于,<think>标记并没有让模型真正“思考”或提升推理能力。即使不用这类标记,模型训练后也能达到相近的基准性能。

而且,<think></think>这两个字符串本身并无特殊之处,换成其他分隔符也能起到相同作用。

顺带一提,这类标记的实现方式通常是在RLVR阶段添加格式奖励。也就是说,除了根据答案正确性给予奖励,还会对使用<think>标记的行为额外奖励,从而鼓励模型使用这类标记。

以DeepSeek-R1为例,总奖励的计算公式为: R_total = R_accuracy + R_format 其中格式奖励是基于简单规则的检查,鼓励模型将推理内容放在: <think> 推理轨迹 </think> 标签之间。

4. 推理模式的开关

第一代推理模型是专用型的——比如,存在一个DeepSeek-V3基础模型,和一个独立的DeepSeek-R1推理模型。

无论输入什么提示词,R1通常都会输出非常冗长的响应,消耗大量token,哪怕是简单提示词也不例外。而且它没有内置的推理模式关闭选项。

后来的模型,如Qwen3等,尝试了混合方案:同一个模型可按需切换为普通指令微调模型或推理模型。

注:部分模型开发者称之为“思考模式”,另一些则称“推理模式”,二者指的是同一行为。

在Qwen3中,这一功能通过分词器的enable_thinking=Trueenable_thinking=False参数实现。底层逻辑是,当设置enable_thinking=False时,会在助手响应开头添加一个空的<think></think>段,从而关闭Qwen3的推理(“思考”)模式。

thinking=Falsethinking=True模式(左侧界面中,空的<think></think>标签是修改后的输入提示词的一部分,不属于生成的答案,因此被隐藏)。

那么,如何在训练阶段实现这种推理时可切换的功能呢?

简言之,正如《Qwen3技术报告》https://arxiv.org/abs/2505.09388中所述,这种开关行为主要通过**监督微调(SFT)**引入,然后在其旗舰大模型的通用强化学习阶段进一步强化。

例如,在通过长思维链SFT和推理强化学习训练出初始推理模型后,会增加一个“思考模式融合”阶段。在这个额外的SFT阶段,模型会同时接触思考模式和非思考模式的示例:

  • /think: <think>{推理内容}</think>{答案}
  • /no_think: <think></think>{答案}

思考模式是默认行为,因此/think可以省略。后续的通用强化学习阶段会进一步强化这种模式切换和格式遵循能力。

这些/think/no_think标记是“软”开关,而前文提到的enable_thinking=False设置(在关闭模式时强制添加空的<think></think>)则是“硬”开关。

换句话说,分词器不会在查询中添加/no_think,而是直接在助手响应开头填充空的<think></think>段。模型只会看到生成后的token,然后直接输出答案。

这种开关功能,本质上是GPT-5.6等模型中推理强度等级的简化版本,下一节将详细介绍。

5. “推理强度”设置的工作原理

本节将简要概述不同推理强度选项的实现方式——这类设置已出现在GPT-5等模型中,如今几乎所有旗舰模型都具备该功能。

具体来说,本文开头展示了Codex GPT 5.6界面的截图,用户可选择多种推理“强度”设置。

下一小节将说明这些设置可能的实现方式,之后我会介绍一些相关的有趣研究论文。

5.1 推理强度与响应长度、质量

遗憾的是,OpenAI并未公开其推理强度设置的实现细节,但已有一些线索可供我们合理推测。

例如,从去年发布的开源gpt-oss模型(我曾在《从GPT-2到gpt-oss:分析架构演进》https://magazine.sebastianraschka.com/p/from-gpt-2-to-gpt-oss-analyzing-the中介绍过)可知,OpenAI允许通过前置到每个提示词的系统提示(“Reasoning effort: low/medium/high”)来切换推理强度设置。

正如预期,推理强度直接影响响应长度和准确性,如下图所示:

模型卡片

推测其GPT 5系列模型,包括最新的GPT 5.6,也采用了类似的方法。

顺带一提,观察上图中不同强度设置下响应长度的变化:强度等级似乎与token用量直接相关,而token用量又与准确性相关。理论上可以设置比“高”强度更高的选项,但性能可能会在某一节点趋于饱和。这一点在GPT 5.6 Sol模型上体现得更明显——增加推理预算在某个阶段会变得不划算。

另一个能体现推理强度、token用量与基准性能关系的最新案例,是Thinking Machine Labs本周发布的开源模型Inklinghttps://sebastianraschka.com/blog/2026/inkling-architecture-benchmark-notes.html。

Inkling发布博客

如本节所述,推理阶段的强度等级可通过系统提示直接控制(ChatGPT界面可能只是将菜单选项映射为对应的系统提示)。但这一方法并非适用于所有模型,需要对训练流程进行特定修改,这将在下一部分讨论。

5.2 强度等级的可能实现方式

尽管GPT 5.6和开源gpt-oss模型的训练细节未公开,但通常会在后训练阶段将推理强度标签纳入提示词中。

主要有两种实现方式:

第一种,将其纳入RLVR流程,针对不同的系统提示设置不同的长度惩罚。例如,当系统提示为“Reasoning effort: low”时设置较高的长度惩罚,而“Reasoning effort: high”时设置较轻或不设置惩罚。

第二种,在RLVR之后通过监督微调(SFT),让模型学会遵循不同的强度指令。

例如,在核心RLVR阶段之后的SFT阶段,训练数据中的提示词会与对应强度的目标响应配对(目标响应可由人工编写、其他模型生成,或生成后经过筛选)。

在这个SFT阶段,模型直接从训练示例中学习强度标签与目标推理长度的关联。而基于强化学习的实现,则是在RLVR阶段加入强度标签和感知预算的奖励机制。这两种方法也可以结合使用,我推测gpt-oss和GPT 5.6都采用了这种组合方式(注:GPT 5.6的强度设置可能只是为用户查询添加对应的系统提示)。

5.3 Inkling案例分析

刚发布的Inkling技术报告,提供了一个具体的强度等级训练示例。

在大规模强化学习过程中,他们对每个样本做了两件事:

  • 在系统消息中指定所需的推理强度等级
  • 调整每个生成token的成本

理论上,奖励机制大致如下:

其中e为请求的强度等级,λ(e)控制token惩罚:

  • 低强度使用更高的单token成本,鼓励生成更短的推理轨迹
  • 高强度使用更低的单token成本,允许模型消耗更多token进行推理

在推理阶段,Inkling会接收类似“Thinking effort level: 0.8”的系统消息,并相应调整token用量。与gpt-oss和GPT-5.6等模型不同的是,Inkling的强度标签是0到1之间的连续数值,而非“低、中、高”这类离散标签。

这意味着Inkling的强度调节主要在推理强化学习阶段完成,而非仅依赖后期的SFT阶段。

不过,报告并未披露具体的奖励公式、token成本系数,也未说明是否在SFT阶段也加入了强度调节。

5.4 推理缩放与训练缩放的简短说明

在介绍推理强度相关论文之前,我想将本节内容与前文“2.3 推理缩放简介”部分联系起来。

之前我将缩放分为训练算力缩放和推理阶段缩放。GPT-5.6的界面很好地展示了二者的区别:

左侧选择Luna、Terra或Sol,是切换模型本身。大致可以类比为训练算力缩放——这些是独立训练的模型。在训练方案和数据集大小固定的情况下,模型越大,所需的训练算力越多,每个生成token的推理算力需求通常也更高。

右侧则是在固定模型的前提下,仅调整推理强度,这属于推理阶段缩放。模型权重保持不变,但允许模型消耗更少或更多token来推导答案。

需要注意一个术语细节:此时从菜单中选择不同模型,并非实时进行训练缩放,因为训练早已完成。更准确地说,模型菜单是在不同训练规模下生成的模型之间进行选择。

下面的人工分析结果展示了这两个维度在实际中的相互作用:

每条蓝色曲线对应一个模型(Luna、Terra或Sol)。沿曲线增加推理强度,属于推理缩放;从一条曲线切换到另一条,则对应模型缩放,这里我将其作为训练缩放的实际替代指标。

正如预期,两种方式都能提升基准测试分数,但也会增加成本。更有趣的是,曲线之间存在重叠——例如,较小的模型在高强度推理下,有时能达到与较大模型在低强度推理下相近的分数。

顺带一提,图中的横轴是API成本,而非原始算力。API成本是一个实用的衡量指标,但它也取决于提供商的定价和生成token的数量。此外,曲线的具体形状也因基准测试而异。

可见,模型大小和推理强度是两个独立的调节旋钮。我们可以选择更大的模型、提高推理强度,或二者结合。哪种组合最优,取决于所需的准确性、成本和延迟。

读到这里,你应该已经对推理强度模式的工作原理和实现方式有了扎实的理解。如果时间有限,读到这里就可以了;如果想了解更多最新开源模型的细节,请继续阅读!

6. 拓展:推理强度的不同实现方式(旗舰开源大语言模型)

[除非你想了解更多细节,否则可以跳过本节]

第5节介绍了两种训练推理强度控制的方法,即基于强度的监督微调,以及设置不同token成本的强化学习。原本我想介绍一些实现推理预算的替代方案的研究论文,但通读后发现,这些论文大多是概念验证,实际效果未知。

因此,我决定转而介绍当前最先进的知名开源旗舰大语言模型所采用的方案——这些方法至少已被证明在实践中有效。

我选取了六个例子:DeepSeek V4、Nemotron 3 Ultra、Kimi K2.5、GLM-5、Qwen3和Inkling。它们的技术报告详细程度不同,但各有独特之处。(我排除了那些仅在界面中展示强度设置、却未说明训练方法的模型。)

6.1 DeepSeek V4:训练独立的强度专用模型

首先来看《DeepSeek V4技术报告》https://www.google.com/url?q=https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro/resolve/main/DeepSeek_V4.pdf?download%3Dtrue&sa=D&source=editors&ust=1784335866750314&usg=AOvVaw2n1GwYNTZHYZE3wfXDbrZJ,它描述了三种模式:

  • 非思考模式:直接输出响应,无推理轨迹
  • 高思考模式:经典模式,模型将推理轨迹放在<think></think>标签之间,与本文开头DeepSeek R1部分(第2节)讨论的方式类似
  • 极致思考模式:与高思考模式类似,但添加了特殊的系统指令(下文详述)

极致思考模式的额外系统指令以“Reasoning Effort: Absolute maximum with no shortcuts permitted.”(推理强度:全力以赴,不允许走捷径)开头。

DeepSeek V4文档

乍听起来这像是一个简单的提示词技巧,但实际上该提示词背后有不同的训练支撑——每种模式都有自己的上下文窗口和长度惩罚(遗憾的是,报告未详细说明长度惩罚的具体实现)。极致思考模式的上下文窗口更长,长度惩罚更小,因此有更多空间进行推理。

也就是说,系统指令选择的是后训练阶段形成的特定行为。将相同指令应用于任意模型,不会产生相同效果。

遗憾的是,公开且内容详实的DeepSeek V4报告,并未将推理模式与领域专用模型的描述充分关联,无法重构确切的教师模型分配方式。

但报告指出,最终支持不同推理强度的模型,是通过在线策略蒸馏从这些专用模型中得到的。

总结来说,DeepSeek V4在后训练阶段开发了三种推理专用模型:从基础模型出发,先进行监督微调,再通过GRPO算法进行RLVR训练。每种模式的强化学习配置不同,尤其是上下文窗口和长度惩罚;极致思考模式还额外添加了特殊系统指令。

之后,包括领域专用模型在内,不同推理模式的专用模型被蒸馏为一个单一模型 checkpoint,支持三种强度模式。

6.2 Nemotron 3 Ultra:结合学习模式与硬性预算

《Nemotron 3 Ultra技术报告》https://www.google.com/url?q=https://research.nvidia.com/labs/nemotron/files/NVIDIA-Nemotron-3-Ultra-Technical-Report.pdf&sa=D&source=editors&ust=1784335866753580&usg=AOvVaw2ekgj61BJagCXY9Lb5Ho9k描述了三种设置:推理关闭、常规、中等强度,与上一节的DeepSeek V4类似。中等强度是比常规模式更经济的推理模式。NVIDIA在SFT阶段引入了该模式,使用GPT-OSS-120B中等强度模式生成的示例,随后在RLVR阶段进一步优化。约2.5%的RLVR提示词采用中等强度设置(对应奖励中基于长度的调整)。

6.2.1 推理阶段使用Nemotron的推理预算

推理阶段,三种模式通过聊天模板选择:

官方模型卡片

  1. 常规模式是默认设置,使用enable_thinking=True,助手响应以<think>标签开头。
  2. 中等强度模式使用enable_thinking=Truemedium_effort=True,后者会在最新用户消息后追加{reasoning effort: efficient}

顺带一提,常规和中等强度模式还可与独立的推理阶段预算结合使用。该预算作为外部停止机制,在已发布的实现中,聊天客户端会要求模型在选定的token限制附近结束推理轨迹。如果模型尚未输出</think>,客户端会关闭推理块,继续生成最终答案。学习到的强度模式决定模型如何使用推理token,而预算则限制推理轨迹的最大长度。这样就可以根据所需的成本和准确性,为任意模式搭配更严格或宽松的预算。 3) 推理关闭模式使用enable_thinking=False,预填充一个空的<think></think>块(与第4节讨论的Qwen3类似),让模型直接输出最终答案。因此,这些是聊天模板层面的控制,而非系统提示。

6.2.2 Nemotron的推理预算感知训练

上述推理控制背后有两个相关的SFT组件:第一个是如前所述,使用GPT-OSS-120B的轨迹引入中等强度行为;第二个是让模型适应硬性推理预算。

为构建训练数据,作者选取常规推理轨迹,在随机选择的token预算处截断,并保留原始最终答案。插入的</think>token会被屏蔽SFT损失。这样,模型就能接触到“推理轨迹被外部截断后,从不完整推理直接跳转至答案”的示例。

中等强度训练在RLVR阶段继续进行:约2.5%的RL提示词在数学、STEM和编码任务中采用中等强度设置。报告指出,可通过奖励超参数校准该模式,基于长度的奖励调整能进一步控制成本与质量的平衡。

6.3 Kimi K2.5:交替进行预算约束与无约束强化学习

《Kimi K2.5技术报告》https://www.google.com/url?q=https://arxiv.org/abs/2602.02276&sa=D&source=editors&ust=1784335866757827&usg=AOvVaw1ZQ2g58qlTcuh8v5EJoJo6讨论了一种名为**Token Efficient RL**的训练方法,用于降低推理强度。(尽管本周发布了K3,但K3的推理强度方法尚未公开,可能与K2.5类似或相关。)

6.3.1 Kimi的Toggle方法

报告提到,固定token预算可能导致推理模型过度拟合短解决方案——模型变得更简洁(更快、更便宜),但可能失去利用额外推理算力的能力,从而表现不佳。

Kimi K2.5采用的Toggle方法,是在固定训练迭代次数后,交替进行两种强化学习阶段:

  1. 预算约束阶段:鼓励正确解决方案保持在特定问题的token预算内
  2. 无约束阶段:恢复常规的最大生成长度,让模型仍能从更长的解决方案中学习

每个问题的预算,由RLVR中正确生成结果的响应长度的选定百分位数估算得出。只有当该问题的平均准确率超过阈值时,才会激活预算约束,避免模型在可靠解决问题前就被迫缩短推理过程。

报告在K2 Thinking模型上测试了Toggle方法,结果显示生成token减少了约25%至30%,而基准性能几乎没有变化。这种行为还能从数学和编码RL任务迁移到GPQA和MMLU-Pro数据集。

Toggle方法为旗舰模型提供了一个具体方案:训练更高效的token推理策略,同时保留测试阶段的性能缩放能力。

6.3.2 Toggle对推理阶段的影响

Toggle完全在强化学习训练阶段运作。两个交替阶段更新的是同一个策略(即大语言模型),最终的统一模型checkpoint没有预算约束/无约束的选择器。推理阶段,模型默认以思考模式运行。

不过,我查看Kimi K2.5的部分API(如vLLM或SGLang)发现,它提供了思考模式与即时模式的二元选择,思考模式默认开启。即时模式通过thinking: {"type": "disabled"}(官方API)或chat_template_kwargs={"thinking": False}(vLLM或SGLang部署时)关闭推理轨迹。但这些设置与Toggle方法无关。

此外,官方Kimi报告未提供即时模式的单独训练方案。不过,K2.5的SFT数据由早期的K2模型(直接输出响应,无长推理)和K2 Thinking模型(生成详细推理轨迹)共同生成。这可能让统一模型接触到两种响应格式,与前文Nemotron 3的做法类似。推理阶段,聊天模板通过预填充<think>标签(思考模式)或空的<think></think>块(即时模式)来切换。但遗憾的是,报告未披露具体的数据混合比例,也未说明是否使用了额外的模式专用强化学习。

最新的Kimi K3提供了更直接的推理阶段强度界面。当前Kimi Code文档列出了低、高、极致三种设置,极致为默认值,通过reasoning_effort参数传递。但Moonshot尚未公开这三种强度等级的训练方法,其发布博文表示相关细节将在未来的K3技术报告中公布,我将持续关注。

6.4 GLM-5:通过SFT引入回合级与交错式思考

《GLM-5技术报告》https://www.google.com/url?q=https://arxiv.org/abs/2602.15763&sa=D&source=editors&ust=1784335866763311&usg=AOvVaw2B0_xQjtDj2xC_zTXgUmxa将GLM-4.5引入的二元思考开关,扩展到多轮对话和工具使用场景。它描述了三种相关行为(而非三种强度等级):

  • 交错式思考:在每个响应和工具调用前插入推理块
  • 保留式思考:对话中保留之前的推理块,供模型后续复用
  • 回合级思考:可针对对话中的每个请求单独开启或关闭推理

推理阶段,回合级思考是实际的开关。在Z.ai API中,思考模式默认开启,可通过thinking: {"type": "disabled"}为单个请求关闭。托管版本的实现未公开,但开源的GLM-5聊天模板展示了使用Transformers、vLLM或SGLang自托管时的等效机制:

开启思考模式时,助手响应以<|assistant|><think>开头;关闭时则以<|assistant|></think>开头,后者立即关闭推理块,让模型直接生成最终答案。

报告指出,这些行为是在多任务SFT阶段结合更新后的聊天模板引入的。

SFT之后,GLM-5会依次进行推理强化学习、智能体强化学习和通用强化学习。最后一步在线策略蒸馏,会使用前面阶段的checkpoint作为教师模型,帮助最终模型恢复在连续强化学习阶段可能弱化的能力。

6.5 Qwen3:模式融合与推理阶段截断

第4节已介绍过Qwen3,这里仅总结与本次对比相关的内容。根据《Qwen3技术报告》https://www.google.com/url?q=https://arxiv.org/abs/2505.09388&sa=D&source=editors&ust=1784335866765752&usg=AOvVaw3VLUySiiox-X0Vw2QPL80b,其后训练流程分为四个阶段:长思维链SFT、推理强化学习、思考模式融合和通用强化学习。

思考模式融合是实现强度开关的关键阶段:在此阶段,模型通过SFT学习思考模式与非思考模式的混合示例。/think示例包含推理轨迹,/no_think示例则以空的<think></think>块开头,搭配简短答案。后续的通用强化学习阶段会进一步强化两种行为的指令遵循和格式遵循能力。

Qwen3还支持硬性思考预算:当达到请求的阈值时,推理过程会被停止,并插入停止思考指令,然后模型继续生成最终答案。报告指出,这种部分推理行为并非显式训练的,而是在思考模式融合阶段后自然涌现的。

这让Qwen3具备了学习到的开关功能,加上推理阶段预算,比DeepSeek V4和Nemotron的方案更简洁。

6.6 Inkling:基于连续强度值的强化学习调节

第5.3节已讨论过Inkling,简而言之,其技术报告提到,它采用连续强度调节(0.0到1.0之间的数值),而非固定的强度标签。

在规模相对较小的初始SFT阶段后,Inkling的大部分后训练来自异步强化学习,包含超过3000万次生成。所需强度会包含在系统消息中,强化学习阶段会根据该值调整token长度惩罚。如前所述,更高的token成本鼓励更短的响应,更低的token成本则给模型更多推理空间。

6.7 已知方案概述

下表总结了上述六个技术报告中实际记录的内容:

观察这六个开源模型,它们有一个共同的框架:首先通过SFT和聊天模板引入强度模式控制——Qwen3显式混合思考与非思考示例,GLM-5则添加交错式、保留式和回合级思考模式。

第二个共同组件是模式感知的强化学习阶段,其中上下文窗口和长度惩罚会随请求的强度变化。DeepSeek V4、Nemotron 3 Ultra和Inkling都采用了这种方法。

第三个要素是提升明确预算下的鲁棒性:Nemotron训练随机截断的轨迹,Qwen3能从强制停止的推理过程继续生成,Kimi则交替进行预算约束与无约束强化学习。这些方法有助于在推理长度变化甚至被截断时,保持答案质量。

7. 结论

本文介绍的开源模型通过多种机制实现推理强度控制。相同的强度标签背后,可能是独立的专用模型、混合SFT数据、模式感知奖励、硬性token预算,或这些方法的组合。

很难说哪种方法最优——这些模型的基础checkpoint、训练数据、后训练算力、基准测试和部署目标各不相同,报告也省略了很多进行受控比较所需的细节。(而且可能不存在通用方案,对交互式助手有效的方法,可能并不适合长期运行的代码智能体。)

当然,终极目标是自动选择推理强度。此前GPT 5曾推出过Auto模式,但这是一个棘手的问题,最终的实现效果可能不尽如人意,因此该模式已从界面中移除(至少我目前找不到了)。

在不久的将来,推理强度仍将是模型的显式输入,最常见的方式是通过系统提示传递。不过,大语言模型的智能体封装/框架,或内部路由机制,可能会越来越多地根据任务状态和可用资源自动推断合适的模式和预算(当然仍允许用户手动覆盖)。

我仍希望强度选择能变得更加自动化——类似GPT 5的Auto模式,一个轻量模型或路由机制可根据请求、工具状态和剩余时间或token预算选择模式,同时允许用户手动覆盖。手动覆盖功能很有用,比如你想优先优化延迟、成本,或追求最高性能。

我知道这篇文章很长,主题可能也不够“吸睛”。但考虑到当前关于大语言模型、推理模型和智能体的讨论热度,我认为推理模型的这一面此前并未被充分覆盖,希望本文能为你提供一个独特且实用的概述!

更多资源

如果你想动手实现推理模型背后的核心训练方法,我的《从零开始构建推理模型》https://sebastianraschka.com/books/#build-a-reasoning-model-from-scratch一书会逐步讲解可验证奖励强化学习和推理阶段缩放技术,并附带代码。

本文聚焦于训练好的推理模型如何支持不同强度模式,而这本书则退一步,展示如何先将传统大语言模型转化为推理模型。它是《从零开始构建大语言模型》https://sebastianraschka.com/books/#build-a-large-language-model-from-scratch的续作,内容衔接前作。

纸质版现已开始发货:

Manning出版社 | 亚马逊

如果你喜欢我的前作《从零开始构建大语言模型》https://amzn.to/4fqvn0D,那么这本书就是它的续篇,从零实现推理阶段缩放技术和强化学习算法。

如果你想支持我继续撰写这类长篇深度文章,欢迎成为付费订阅用户。这将帮助我持续创作独立的深度分析内容,并分享配套代码、图表和实验。