RecodeX 重构消息,腾讯基于Qwen3.5-122B-A10B训练出终端Agent模型T1,专攻Linux终端中的复杂任务,单个任务最多可连续调用工具300多轮。在Terminal-Bench 2.1上,T1得分从底模的43.8%提升至64.0%,提高20.2分。
其中大部分提升来自强化学习:SFT阶段仅将分数拉至49.4%,后续强化学习再涨14.6分。团队准备了约1.5万个终端任务,每个任务配有自动测试,Agent完成部分要求即可获得相应奖励。
针对长任务中训练与推理的token切分及MoE专家选择偏差,T1会记录生成时的token和选中专家并在训练时重放,将训推偏差压低约三分之一。