RecodeX 重构消息,最新前沿AI模型对比显示,xAI的Grok 4.7定价为每百万token输入2美元、输出6美元,约为GPT-5.6的一半,仅为Anthropic Fable 5.1 Max的五分之一。
基准测试中,Fable 5.1仍拿下最多项目,包括CursorBench(51.8%)、Terminal-Bench(57.9%)、AA-Briefcase(1678)和HealthBench(62.1%),其在多小时终端任务上领先约20个百分点。但Grok 4.7在电气工程(64.0%对56.4%)和法律工作(19.6%对6.7%)上明显胜出,在DeepSWE和办公任务上与领先者仅差一两个百分点。GPT-5.6仅在DeepSWE(72.7%)居首,法律(2.5%)和电气工程(39.4%)表现落后。