RecodeX 重构消息,VulcanBench于10月4日公布Frontier v4评测结果。Grok 4.7在Cursor编码智能体CLI上完成23项任务,最高推理档位得分93.15分排名第一,高、中档位分别以92.71分和92.30分位列第二、第三,低档位以89.42分排第12位。
评测显示推理档位越高通过任务越多,但耗时也更长:低档位通过23项中的18项,平均每题20.2分钟;最高档位全部通过,平均每题28.5分钟。由于各模型评测的评审构成不同,仅凭分数难以断定其编码能力优于其他模型。
RecodeX 重构消息,VulcanBench于10月4日公布Frontier v4评测结果。Grok 4.7在Cursor编码智能体CLI上完成23项任务,最高推理档位得分93.15分排名第一,高、中档位分别以92.71分和92.30分位列第二、第三,低档位以89.42分排第12位。
评测显示推理档位越高通过任务越多,但耗时也更长:低档位通过23项中的18项,平均每题20.2分钟;最高档位全部通过,平均每题28.5分钟。由于各模型评测的评审构成不同,仅凭分数难以断定其编码能力优于其他模型。