RecodeX 重构消息,Meshy团队提出一种角色驱动的SPMD范式强化学习训练框架,将Inference、Training、Rollout和Teacher等角色建模为独立服务,不再以分布式编排框架作为RL系统的中心。所有样本数据通过统一的TransferQueue数据面在服务间流动,控制流程由数据驱动,拓扑由各进程启动时在本地按相同配方推导,使RL流程更接近预训练框架常用的SPMD设计。该框架天然支持全异步训练,同时兼容传统同步训练,相比Single-Controller设计可避免大量RPC调用并摆脱对Ray的依赖。