RecodeX 重构消息,清华大学等多机构研究者开展On-Policy Distillation(在线策略蒸馏,OPD)研究,将训练集缩减至1道题后发现,模型训练几百步仍能持续提升,单题训练可恢复全量数据约70%以上收益,在数学、coding等多任务及不同模型上均有类似效果,且对训练题性质不敏感。
研究指出,数据侧1道题经反复rollout可摸到全量状态空间的71.5%,16道不同语义簇的题即可达到与全量数据相当的效果;算法侧模型吸收监督的速度随训练推进逐渐变慢,训练集大小对吸收率影响极小。在多教师OPD设置下,每个领域16道语义不同的题即可打平全量效果。
对比RLVR,OPD训练涨幅更高,但二者天花板受限于不同因素。研究认为应关注题目能否带模型到未访问状态、Teacher是否有可教内容及学生吸收速度。