RecodeX 重构消息,Terminal-Bench发布4.0版本,重新校准Agent执行任务的时间、CPU和内存,修复19个任务,移除8个存在饱和、拒答、公开解法或质量问题的任务,所有任务最长执行时间统一为8小时。最新榜单中,Opus 5 + Claude Code以51.8%居首,Fable 5以44.5%第二,GLM-5.3 + Claude Code以41.8%升至第三,超过GPT-5.6 Sol + Codex的37.3%。在3.0版本中,GLM-5.3以32.4%排第四,落后GPT-5.6 Sol的34.6%;4.0版本中反超4.5个百分点。
Terminal-Bench 4.0发布:GLM-5.3升至第三超GPT-5.6 Sol
更多报道脚本之家 ↗
AI 辅助判断中性仅供信息参考,不构成投资建议
原始信息来源区块律动theblockbeats.info
查看原文 ↗