RecodeX 重构消息,北京大学DCAI团队等联合发布开源框架DataFlex-RL,面向大模型强化学习后训练中动态数据策略接入难、不同策略难以公平对比的问题。该框架复用verl训练流程,将数据选择、样本重加权、领域配比调整三类动态数据策略做成可配置组件,共享训练中产生的奖励、优势等信号,实现打分与执行解耦,可在同一RLVR/GRPO流程中灵活切换和验证不同数据策略。团队完成591次覆盖多类模型及数学、逻辑、科学任务的实验,验证了各类数据策略的实际效果。该框架是开源项目DataFlex向强化学习训练环节的延伸。