RecodeX 重构消息,一项针对大模型后训练的研究以OPD在线策略蒸馏为初始场景开展实验,发现仅保留单条推理轨迹中1个token的极端稀疏梯度信号,不仅不会导致训练崩溃,还能显著提升大模型的推理能力。

团队基于9组不同师生模型配置测试发现,选取轨迹中师生模型输出分歧最大的1至2个token作为监督信号,效果甚至超过全信号训练,所得学生模型性能可超越教师模型,且并非单纯模仿教师。该现象在代码推理任务、Llama系列模型以及RLVR后训练范式中均得到验证。

机制研究显示,推理性能提升与监督信号稠密程度并非单调关系,万分之一的监督信号仅需更新10%的网络参数即可大幅提升推理能力,效果差异还与师生模型表征能力的相对强弱有关。