RecodeX 重构消息,三星大模型团队联合牛津大学、北京大学提出基于信任域的On-Policy Distillation方法TrOPD,用于解决端侧小模型继承大模型能力时,现有OPD方法因师生模型能力差距过大导致监督信号失真、训练不稳定的问题。

研究指出,OPD训练成败的关键在于教师能否对学生生成的每个token给出可靠监督,而非散度公式的选择。TrOPD通过识别教师可信监督区域,在信任域内采用常规在策略学习,在离群区域改用更温和的监督,并引入离策略引导将学生生成拉向信任区域。

实验显示,TrOPD在数学、代码、指令遵循、STEM等基准上全面超越现有OPD改进方法,且师生模型能力差距越大优势越显著,为前沿AI低成本部署到数亿终端提供了新路径。