RecodeX 重构消息,斯坦福团队提出LLM-as-a-Verifier自验证框架,让DeepSeek V4 Flash在Terminal-Bench 2.1上任务成功率从79%提升至88%,超越Claude Fable 5,整体成本低约11倍。该方法通过生成5条候选轨迹,并利用同一模型进行验证、打分和排序,无需更强闭源模型。项目已开源,冲上GitHub Trending热榜第2位。