这项由马里兰大学帕克分校(University of Maryland, College Park)研究团队完成的研究,以预印本形式发表于2026年7月30日,论文编号为arXiv:2607.28582,感兴趣的读者可通过该编号在arXiv平台查询完整论文。
训练一个会推理的AI,本质上是在教它"如何思考"。然而,这件事远比听起来要复杂。最近几年,大语言模型(也就是ChatGPT这类AI的核心)在数学推理、逻辑推断等任务上取得了令人印象深刻的进步,背后的一个关键手段是让模型"自我提升"——用它自己生成的答案来训练自己,同时借助一个"知道标准答案"的老师版本来提供指导。这种方法叫做**在线策略自蒸馏**(On-Policy Self-Distillation,简称OPSD),听起来很玄,但本质上可以用一个很接地气的画面来理解。
假设你是一个正在备考的学生(这里把它叫做"学生模型")。你自己先做一道数学题,然后对照一份有详细解题过程的标准答案(这就是"老师模型",它知道答案)来检查哪里做错了,再把做错的地方重新练习。与在图书馆死背别人写好的笔记不同,这种方式让你从自己真实犯错的地方学习,效果理论上要好得多。OPSD的思路正是如此。
但问题来了:这个方法在实际操作中非常不稳定。就像某些学生被强迫直接去对标顶尖高手的答案,差距太大往往会导致信心崩溃、越练越乱。研究团队在这里发现了一个隐藏的根源,并由此开发出了一套更聪明的训练框架,称为**β-OPSD**。这项研究的意义不仅在于让AI训练更稳定,更在于它揭示了一个被以往研究忽视的数学结构——原来"直接模仿老师"只是一种更宏大方法的特殊情形。
一、一个被隐藏起来的秘密:直接模仿老师其实只是"极端情况"
备考的那个比喻可以继续用。现有的OPSD方法就像是强迫学生每次做完题,都必须把自己的答案风格调整到和标准答案完全一致——无论自己目前的水平如何,目标始终是"完全复制老师"。这在数学上对应的是最小化学生和老师之间的一种差距度量,叫做KL散度(可以理解为"两种行为方式之间的不同程度")。
研究团队发现,这其实只是一族更宽泛方法里最激进的那个版本。他们从一个经典的强化学习框架出发:训练一个AI策略,既要让它在某个任务上表现好(获得奖励),又不能让它偏离某个"参考版本"太远(用KL散度来惩罚偏离)。这里有个关键参数,叫做β,它控制着"允许偏离参考版本的程度"。β越大,AI越保守,只敢小步前进;β越小,AI越激进,更愿意大胆改变。
当他们把老师和参考版本之间的概率比值设定为奖励信号时,一件神奇的事情发生了:β=1时,这个框架和传统的OPSD完全等价。换句话说,**传统OPSD不过是β等于1这个特殊情况**,而在此之外,还有一整条由不同β值组成的训练策略光谱。这就好比你以前只知道烤箱有一个固定温度(180℃),而现在发现烤箱其实是可调的,180℃只是其中一档。
这个发现的价值在于:它把β从一个"被默认固定在1上、从未被人注意过"的隐藏参数,变成了一个**可以主动调控的旋钮**。拧大β,训练更保守稳健;拧小β向1靠近,训练更激进地向老师靠拢。这直接给了研究者一种有理论依据的方式来控制训练的节奏。
二、最优目标的数学形式:参考版本和老师之间的"插值路径"
知道β是个可调旋钮之后,下一步自然是:对于任意一个β值,最优的训练目标究竟长什么样?研究团队推导出了一个漂亮的闭合形式解(也就是说,不需要迭代计算,可以直接写出来的精确答案)。
结果是一个几何插值(geometric interpolation)——可以理解为两种东西按比例"混合"。具体来说,最优策略是**参考版本的概率分布**和**老师版本的概率分布**按照一定比例在对数空间里混合后的结果。比例由β决定:β=1时,混合比例完全偏向老师,这正是传统OPSD;β趋向无穷大时,混合比例完全偏向参考版本,相当于什么都没学。
还是用备考的画面来理解:参考版本就是你目前的做题风格,老师版本是标准解答。不同的β值对应着不同的"目标答题风格"——β=1时你的目标是完全模仿老师,β很大时你的目标更接近你自己当前的风格(只做轻微调整),而中间的β值则对应一个介于两者之间的"折衷版本"。这些折衷版本排成一条连续的路径,从"完全是自己"走向"完全是老师"。
这条路径的发现至关重要,因为它提供了一种**有原则的课程设置方式**:训练初期,让目标靠近当前的自己,不要步子太大;随着训练推进,逐步让目标向老师靠拢。这就像一个好的私教,不会在第一节课就要求你完成奥运级动作,而是从你当前水平出发,一步步加大挑战。
三、从理论到实践:用"混合药水"代替"直接照搬"
推导出了这个最优策略之后,一个工程问题随之而来:这个解在实际使用中是不可直接操作的,因为它的分母(归一化常数Zβ)需要对所有可能的文本序列求和——而语言模型的文本空间是天文数字级别的,根本没法算。
研究团队的聪明之处在于:他们没有试图直接优化这个强化学习目标(那需要大量采样和高方差的梯度估计,代价极高),而是把理论导出的最优解"翻译"成了一种高效的蒸馏目标。具体做法是在每个生成位置上(每次预测下一个词时),把参考版本的"对各词的打分"(在深度学习里叫logits,可以理解为每个词的"意愿值")和老师版本的"对各词的打分"按比例线性混合,然后通过softmax函数转化成概率分布。
这个操作对数学有点了解的读者可以这样理解:在概率层面做几何平均,等价于在对数层面做线性平均。因此,把参考的logits和老师的logits按`(1 - 1/β)`和`1/β`的比例加权求和,再过一个softmax,就得到了序列层面最优策略的局部近似。整个过程不需要任何归一化常数,计算成本和原有的蒸馏训练几乎一样,只是多了一次向量加法。
这个插值目标(研究里称为logit-interpolant target)就像是每次给学生的"参考答案"都是老师答案和学生自己答案按比例调配的"混合版本"。训练早期,混合比例偏向学生自己,目标易于达到,训练信号稳定;随着训练步数增加,混合比例逐渐偏向老师,目标变得更有挑战性。研究团队在实验中默认使用了一个线性递增的混合计划:从0.5(老师和自己各占一半)线性增加到0.8(老师占八成),覆盖整个200步的训练过程。
四、另一个被忽视的问题:每个词"背多少锅"?
修正训练目标之后,研究团队注意到传统OPSD还有另一个设计缺陷,这个缺陷藏得更深,但同样值得关注。
在语言模型生成一段文字的过程中,每个词是依次产生的,前面的词会决定后面词所处的上下文。传统的训练方式对每个生成的词都单独计算"它和老师目标的差距",然后用这个差距来更新模型参数。这就好比在分析一道菜做失败的原因时,只看最后那道工序,而完全不追究前面哪个步骤埋下了隐患。
事实上,一个早期生成的词改变了整个文本的走向,从而影响了后续所有词和目标之间的差距。如果只用即时的局部差距来更新早期词的参数,就相当于给了它一个"误导性的成绩单"——明明它的选择波及深远,评价却只看眼前。
研究团队从强化学习中的经典方法(REINFORCE算法)借来了一个解决思路:**回报到末端(return-to-go)加权**。对于每个生成位置t,不再只用该位置的即时差距,而是用从t到序列结束的所有差距的(折扣)累加和来作为权重。这个权重反映了"从第t个词开始,后续所有词和目标之间的总差距",从而让早期词能够承担起它对后续结果造成的责任。
在数学上,研究团队证明了:当折扣系数γ=1时,这种回报到末端加权方式提供的梯度是序列层面KL散度梯度的无偏估计。也就是说,它在统计意义上更正确地反映了"如何最优地降低整条序列与目标的差距"。在实际操作中,他们使用γ=0.99(略小于1),这可以在不显著引入偏差的同时控制长序列中权重爆炸的问题。
把这两个改进组合起来,就得到了β-OPSD的完整训练流程:每一步先用插值logit构造目标分布,再计算每个生成位置的差距,然后用回报到末端加权后的信号更新模型参数。整个过程中,插值权重和累积权重都被"切断梯度"——也就是说,模型只通过调整自己的预测概率来改变损失,不会通过这些权重的值来反向传播,保持了训练的干净和稳定。
五、实验结果:这套方法在真实测试中表现如何?
研究团队在三个竞赛级数学推理基准上评估了β-OPSD:AIME 2024、AIME 2025(美国数学邀请赛,对高中数学竞赛选手而言已经颇具挑战性)和HMMT 2025(哈佛-MIT数学锦标赛,难度更上一层楼)。他们在Qwen3系列模型上进行实验,分别测试了1.7B、4B和8B三个规模(B代表十亿参数,可以理解为模型的"体量")。训练数据使用了OpenThoughts数据集中的数学推理子集,每道题都配有标准解题过程作为特权信息。
评估指标是avg@12,即对每道题独立生成12个答案,统计12个答案的平均正确率。这比单次生成的结果更能反映模型真实的推理能力,也更能揭示模型在多次尝试中的稳定性。
结果颇为直观地说明了问题。对于最小的Qwen3-1.7B模型,β-OPSD相比传统OPSD在AIME 2024、AIME 2025和HMMT 2025上分别提升了9.16、5.27和2.78个百分点,平均提升高达5.74个百分点。这是一个相当显著的提升,尤其考虑到它仅仅改变了训练目标的构造方式,并没有增加训练数据或计算资源。
对于中等规模的Qwen3-4B和最大的Qwen3-8B,β-OPSD的平均提升分别为1.76和1.66个百分点。提升幅度随模型规模增大而有所收窄,这与直觉相符:小模型和老师之间的"分布差距"更大,从插值路径中获益也更多;大模型本身能力已经更强,学习起来更容易接受直接的老师指导。
相较于其他基准方法,β-OPSD在所有模型规模上都稳定优于监督微调(SFT,即直接在标准答案上做下一词预测训练),也优于GRPO(一种基于奖励信号的强化学习方法)。这个比较有意义,因为GRPO是目前业界常见的推理增强训练方法之一,β-OPSD在不引入任何奖励模型或外部反馈的条件下超过了它。
六、拆解每个零件的贡献:消融实验的发现
为了搞清楚是"混合目标"还是"回报到末端加权"在起作用,研究团队做了一系列受控的消融实验,每次只改变一个变量。所有消融实验都在Qwen3-1.7B上进行。
第一组实验专门测试混合目标的贡献。他们让两种训练方案都使用回报到末端加权,唯一的区别是目标:一种用纯老师分布,另一种用混合插值目标。结果是使用混合插值目标在AIME 2024上高出6.03个百分点,在AIME 2025上高出5.30个百分点,在HMMT 2025上高出1.67个百分点。这说明"目标用混合版还是纯老师版"本身就有很大影响,而插值目标的优势来自它更平滑、更贴近学生当前水平的指导信号。
第二组实验专门测试回报到末端加权的贡献。两种方案都使用相同的混合插值目标(固定混合比例为0.5),唯一区别是权重方式:一种用即时差距作为权重,另一种用回报到末端的累积差距。结果是回报到末端加权在AIME 2024、AIME 2025和HMMT 2025上分别多出1.12、5.55和3.61个百分点。这证明了"让早期词承担后续后果"的序列级信用分配确实对训练有实质性帮助。
第三组实验检验了插值的两个"端点"应该怎么取。研究团队对比了三种构造方式:两端都用初始模型的固定版本、两端都用当前训练中模型的动态版本,以及用动态版的学生加固定版的老师(这也是他们默认的方案)。结果显示动态学生加固定老师的方案在三个基准上都表现最好。这背后的逻辑很直观:学生端需要跟踪模型的实时进展(否则目标会越来越不匹配当前模型),而老师端保持固定则确保了训练信号的稳定性和权威性,不会随着模型的变化而漂移。
第四组实验考察了混合比例的调度方案。研究团队测试了固定比例(始终0.5)以及多种线性递增或递减方案(从0.2到0.8、从0.8到0.2、从0.5到0.8、从0.8到0.5)。结果显示0.5到0.8的递增方案整体表现最好,但不同调度方案在不同基准上的最优选择有所不同。这说明混合比例的时间安排是个重要的实践决策,也意味着自适应的调度策略(根据训练进展动态确定最优比例)可能是一个值得未来探索的方向。
七、还有一种玩法:直接从混合分布中采样
除了改变训练目标,研究团队还探索了另一种变体:在生成训练样本时,不再完全依赖学生模型自己生成,而是从学生模型和老师模型的概率混合中采样。这样生成的轨迹既保留了学生的探索风格,又掺入了部分老师的"指引",理论上可以产生更高质量的训练样本。
然而,这种做法在工程上有一个显著缺点:生成时需要同时运行两个模型(学生和老师)并在每个词上合并它们的概率,而现有的推理加速框架(如vLLM)并不原生支持这种双模型并行采样,实现起来需要额外的工程工作,速度也几乎慢了一倍。此外,由于采样分布不再是纯学生模型,训练时需要用重要性采样(importance sampling)来纠正这种偏差,而重要性采样会引入额外的方差,使训练不稳定。
实验结果表明,这种混合采样方案在特定超参数下也能取得与主方案相近的提升,但没有某个单一设置在所有基准和所有训练步数上都稳定占优。考虑到它带来的工程复杂性和潜在的不稳定性,研究团队最终将学生在线采样确定为β-OPSD的默认实现方式。
归根结底,这项研究做的事情并不神秘:它把一个本来就在用的训练方法放到了一个更大的数学框架下,发现了一个被大家长期忽视的控制旋钮,然后利用这个旋钮设计出了一个更聪明的训练策略——先从学生自己的水平出发设置目标,再随着训练进行逐渐向老师靠近,同时还修正了原有方法在"责任归因"上的短视问题。整套改动加在一起,让模型在竞赛数学推理任务上的表现有了实质性的提升,而额外的计算开销几乎可以忽略不计。
对于AI领域之外的读者来说,这个研究揭示了一个更普遍的道理:好的"教学设计"对AI同样重要。不是把最难的答案直接摆在学生面前,而是根据学生当前的水平设计一条平滑可走的路径,才是让学习真正发生的方式——无论学生是人还是神经网络。
未来的工作方向可能包括:寻找理论上最优的混合比例调度策略,而非依赖人工调参;将回报到末端权重与方差控制技术结合,进一步提升训练稳定性;以及把这套方法推广到数学推理之外的更多任务领域,验证其泛化能力。有兴趣深入了解这套方法的理论细节和完整实验数据的读者,可以通过arXiv编号2607.28582查阅原论文。
Q&A
Q1:β-OPSD和传统OPSD相比,核心区别在哪里?
A:传统OPSD始终把老师模型的分布作为唯一训练目标,而β-OPSD把目标替换成了老师分布和参考分布(学生自身)之间按比例混合的插值版本,并在训练过程中逐渐增加老师所占比例。此外,β-OPSD还改用了回报到末端加权来替代传统的即时局部差距,使每个生成词能够承担对后续生成的影响。
Q2:为什么小模型从β-OPSD获益更多?
A:小模型(如1.7B参数)和老师模型之间的"能力差距"更大,直接模仿老师等于要学生直接跨越一道宽沟,训练信号不稳定甚至可能起反效果。β-OPSD通过插值目标把这道沟变成了一段缓坡,让小模型能从离自己更近的目标开始学习,所以提升幅度更为显著。大模型本身能力已经更接近老师,这个问题没那么突出,所以提升相对较小但仍然稳定。
Q3:β-OPSD训练需要额外增加多少计算成本?
A:几乎不需要额外成本。混合插值目标的构造只需要把参考模型和老师模型的logit向量做一次加权求和再过softmax,运算量极小。回报到末端加权则是在已有的差距数值上做一次累加,也不涉及额外的模型前向计算。整体来看,β-OPSD的训练成本和传统OPSD基本相当。