RecodeX 重构消息,Terminal-Bench 3.0最新榜单显示,Claude Opus 5(搭配Mini-Swe-Agent)以43.5%的任务成功率位居第一,超越GPT-5.6 SOL(搭配Codex)的34.6%。第三名由Claude Fable 5搭配Claude Code获得,成绩为34.1%。该基准测试于7月23日上线,首版包含74道任务,覆盖7个领域,并引入GPU、多容器网络等复杂环境。需注意,榜单评估的是“模型+代理”整套系统的综合能力,而非单一模型表现。