RecodeX 重构消息,小米MiMo负责人罗福莉在MiMo-V2.6发布后解释该轮强化学习思路。她表示,自己曾参与DeepSeek R1,而MiMo-V2.6背后的研究创新与工程挑战在她看来已超过R1。
她同时说明MiMo为何并用MixRL与MOPD:MixRL将代码、通用Agent、视觉和网络安全等可验证任务混在同一轮强化学习中训练;MOPD则处理超长、难验证或奖励较主观的任务,先单独训练,再把能力整合回主模型。
游戏、3D等任务单次运行时间过长且难以自动判定对错,若与代码任务同轮训练会明显拖慢进度,因此MiMo将其单独训练,再通过MOPD合回主模型。