RecodeX 重构消息,Terminal-Bench发布4.0版本,重新校准Agent执行任务的时间、CPU和内存,修复19个任务,移除8个存在饱和、拒答、公开解法或质量问题的任务,所有任务最长执行时间统一为8小时。最新榜单中,Opus 5 + Claude Code以51.8%居首,Fable 5以44.5%第二,GLM-5.3 + Claude Code以41.8%升至第三,超过GPT-5.6 Sol + Codex的37.3%。在3.0版本中,GLM-5.3以32.4%排第四,落后GPT-5.6 Sol的34.6%;4.0版本中反超4.5个百分点。