RecodeX 重构消息,斯坦福团队提出LLM-as-a-Verifier自验证框架,让DeepSeek V4 Flash在Terminal-Bench 2.1上任务成功率从79%提升至88%,超越Claude Fable 5,整体成本低约11倍。该方法通过生成5条候选轨迹,并利用同一模型进行验证、打分和排序,无需更强闭源模型。项目已开源,冲上GitHub Trending热榜第2位。
斯坦福自验证框架让DeepSeek V4 Flash超越Claude Fable 5
AI 辅助判断积极AI 看多仅供信息参考,不构成投资建议
原始信息来源投资界news.pedaily.cn
查看原文 ↗