事件追踪 · 持续发展中

三星TrOPD蒸馏方法

持续追踪三星TrOPD蒸馏方法相关报道与进展。

我的关注 →RSS 订阅
关注仅保存在当前浏览器和域名中,无需登录,不会自动跨设备同步。

事件时间线

按最新发布排序

持续追踪三星TrOPD蒸馏方法相关报道与进展。

Readhub积极AI 看多

三星联合牛津北大提出TrOPD方法,提升端侧小模型蒸馏稳定性

RecodeX 重构消息,三星大模型团队联合牛津大学、北京大学提出基于信任域的On-Policy Distillation方法TrOPD,用于解决端侧小模型继承大模型能力时,现有OPD方法因师生模型能力差距过大导致监督信号失真、训练不稳定的问题。

研究指出,OPD训练成败的关键在于教师能否对学生生成的每个token给出可靠监督,而非散度公式的选择。TrOPD通过识别教师可信监督区域,在信任域内采用常规在策略学习,在离群区域改用更温和的监督,并引入离策略引导将学生生成拉向信任区域。

实验显示,TrOPD在数学、代码、指令遵循、STEM等基准上全面超越现有OPD改进方法,且师生模型能力差距越大优势越显著,为前沿AI低成本部署到数亿终端提供了新路径。