Register and share your invite link to earn from video plays and referrals.

AI Dance
@AI_Whisper_X
China AI insider | Silicon Valley Decoded 一边盯硅谷,一边扒中国AI 算法 + VC 双视角 · 讲人话 📬 aidance.info@gmail.com
Joined October 2024
293 Following    5.9K Followers
分享一篇Sebastian Raschka 的深度长文,讲 LLM 推理力度(reasoning effort)档位,比如 GPT-5.6 那种 low/medium/high 选项,到底是怎么训练出来的。蛮有意思的 1/ 背景铺垫 - 推理模型不是真像人一样思考,只是会先输出一段中间推理轨迹(reasoning trace)再给答案。 - 主流训练方法是 RLVR(可验证奖励的强化学习):主要用在数学、代码这类结果能自动验证的领域,用“答对=1、答错=0”的奖励信号训练。DeepSeek-R1-Zero 证明了纯 RL 就能让模型学会推理和自我纠错(Aha 时刻)。 - 一个容易误解的点: 标签本身不赋予模型思考能力,纯粹是给 UI 和训练管线用来切分推理过程和最终答案的定界符,靠格式奖励训出来的。 2/ 从推力开关到推理档位 - 第一代是专门的推理模型(如 O1、R1),面对简单问题也经常输出很长的推理。 - 第二代出现了开/关切换(如 Qwen3):训练时混入带推理和不带推理的样本(Thinking Mode Fusion),推理时通过在回复开头预填一个空的 来硬关闭思考。 - 档位(effort level)是这个开关的精细化版本。实现思路有两条,两种方法也可以结合,作者推测 GPT-5.6 和 gpt-oss 可能采用了组合方案: ---RL 阶段做:系统提示写明档位,配合不同的 token 长度惩罚,低档位罚得重,高档位罚得轻(允许长想)。 ---SFT 阶段做:给训练 prompt 配上不同推理力度的目标回答,让模型学会“看到档位标签就调整推理长度”。 3/ 两个缩放维度的区分 - 选 Luna/Terra/Sol 不同型号 = 训练算力的缩放(选的是不同规模的模型); - 调 effort 档位 = 推理算力的缩放(同一个模型,多花点 token)。 4/ 六家开源旗舰的实现对比 - DeepSeek V4:作者按技术报告的总结,是训了三个独立的档位专家(Non-think / Think High / Think Max,各配不同的上下文窗口和长度惩罚),再蒸馏进同一个模型。 - Nemotron 3 Ultra:SFT 时用随机截断的推理轨迹训练,让模型学会“推理被外部掐断后照样给出答案”,支持硬性 token 预算。 - Kimi K2.5:Toggle 方法,RL 时在“限预算”和“不限预算”两个阶段交替,token 用量降了 25–30%,性能几乎不掉。 - GLM-5:重点在多轮和工具调用场景的逐轮开关。 - Qwen3:模式融合 + 推理时截断(截断这个能力是训完自己涌现出来的,没专门训过)。 - Inkling:最特别,用 0–1 的连续effort 值而不是离散档位,RL 时按该值调整每 token 成本。 作者认为短期内 effort 仍会是显式输入,终极目标是自动选档(像 GPT-5 的 Auto 模式,但那次做得不成功被下架了),未来更可能由 agent 框架或路由器根据任务状态自动推断档位,同时保留用户手动覆盖的能力。
Show more
How can an LLM switch between low-, medium-, and high-effort reasoning? And how does an LLM learn to reason more or less? I put together a “little” article explaining how these effort levels are implemented at inference time and during training.
Show more