RecodeX 重构消息,小米正在公开直播下一代大模型MiMo-V2.6的强化学习训练过程。负责人罗福莉表示,团队沉默近半年,一直在研究强化学习能扩展到多大规模,V2.6目前仍在训练中,具体技术方案将在未来几周陆续开源。

此次训练规模较高:每一步使用1568个prompt,每个生成16条rollout,总计约20亿Token,全程异步运行;代码、通用、视觉、网络安全和聊天等Agent任务被混在同一次训练中,并同时使用多套harness。外界可实时查看每一步的任务组成、上下文长度、训练耗时等内部指标。UC Berkeley博士生Yichuan Wang根据面板观察到,每一步约1500个任务,代码任务占约三分之二,同时活跃的沙箱超过4万个。