RecodeX 重构消息,中国科学技术大学与阿里巴巴集团研究团队提出ADRS(Agentic Reinforcement Learning with Self-Distilled Reward Shaping),将训练期的特权技能转化为与回报相关的token级信用,并接入原生reward-to-advantage-to-policy路径,以解决多轮智能体强化学习中的时间信用分配难题。

该方法在轨迹采样与actor更新之间构造信用层,不改变底层RL算法,推理阶段不读取技能文本。在ALFWorld、WebShop和搜索式QA三类环境上,覆盖Qwen2.5-3B/7B与Qwen3-1.7B。150步共同预算下,3B模型ALFWorld成功率达94.5%,较最强基线提升10.1个百分点;WebShop的Score/Success为87.5/76.6;7B模型ALFWorld达96.1%。消融实验中,GiGPO为82.8%,ADRS(无TVA)为87.5%,ADRS+TVA为89.8%。