RecodeX 重构消息,苹果联合Hasso Plattner研究所发表论文,通过超200组GRPO强化学习推理训练实验发现,高资源语言用母语推理训练与英语训练的性能差距普遍在2个百分点以内,其中中文仅差1.1个百分点,打破“推理必须用英语”的共识。实验还显示跨语言迁移广泛有效,低资源语言训练有时能带来更强泛化,多语言混合训练性价比高,但部分模型-语言组合会触发特定任务的极端性能塌方,需逐语言、逐任务、逐模型排查风险。