RecodeX 重构消息,Terminal-Bench 3.0最新榜单显示,Claude Opus 5(搭配Mini-Swe-Agent)以43.5%的任务成功率位居第一,超越GPT-5.6 SOL(搭配Codex)的34.6%。第三名由Claude Fable 5搭配Claude Code获得,成绩为34.1%。该基准测试于7月23日上线,首版包含74道任务,覆盖7个领域,并引入GPU、多容器网络等复杂环境。需注意,榜单评估的是“模型+代理”整套系统的综合能力,而非单一模型表现。
终端基准3.0榜首易主:Opus 5以43.5%登顶
AI 辅助判断中性仅供信息参考,不构成投资建议
原始信息来源脚本之家jb51.net
查看原文 ↗