RecodeX 重构消息,斯坦福大学与NVIDIA Research研究人员开源System One模型CLM-8B,用于帮助Agent在候选动作中快速做出判断和选择,跳过长文本生成。该模型将“当前状态”与“候选动作”分开计算,固定动作可提前算好反复使用,官方测试中整体表现接近Jev,最高将延迟压低约9倍。

团队还测试了CLM为Coding Agent挑选答案的能力:Opus 5和Fable 5先生成多份候选方案,再由微调后的CLM选出一份。DeepSWE上,CLM把Opus 5的单次成功率从73.7%提升至81.6%;Terminal-Bench 2.1上从84.0%提升至87.6%。CLM本身不写代码,测的是能否从现成方案中挑出更优解。

CLM-8B基于冻结的Qwen3-8B,仅额外训练状态和动作投影头,训练数据包括约6000万组问答、3000万个困难负样本和约100万条Agent轨迹。代码和模型权重均已开放,采用Apache 2.0许可。