事件追踪 · 持续发展中

清华On-Policy蒸馏研究

持续追踪清华On-Policy蒸馏研究相关报道与进展。

我的关注 →RSS 订阅
关注仅保存在当前浏览器和域名中,无需登录,不会自动跨设备同步。

事件时间线

按最新发布排序

持续追踪清华On-Policy蒸馏研究相关报道与进展。

Readhub积极

清华团队研究:On-Policy Distillation单题训练可恢复全量数据七成收益

RecodeX 重构消息,清华大学等多机构研究者开展On-Policy Distillation(在线策略蒸馏,OPD)研究,将训练集缩减至1道题后发现,模型训练几百步仍能持续提升,单题训练可恢复全量数据约70%以上收益,在数学、coding等多任务及不同模型上均有类似效果,且对训练题性质不敏感。

研究指出,数据侧1道题经反复rollout可摸到全量状态空间的71.5%,16道不同语义簇的题即可达到与全量数据相当的效果;算法侧模型吸收监督的速度随训练推进逐渐变慢,训练集大小对吸收率影响极小。在多教师OPD设置下,每个领域16道语义不同的题即可打平全量效果。

对比RLVR,OPD训练涨幅更高,但二者天花板受限于不同因素。研究认为应关注题目能否带模型到未访问状态、Teacher是否有可教内容及学生吸收速度。