RecodeX 重构消息,在50项任务的Newsroom Reliability v0.2测试中,SpaceXAI的Grok 4.6以0.79分排名第一,单任务成本约0.0056美元。OpenAI的GPT-5.6 Sol以0.77分紧随其后,多个GPT-5.6变体及Anthropic的Claude Opus 4.8也以接近分数位居其后。
Grok 4.6登顶新闻可靠性基准 得分0.79
后续报道
Grok 4.6登顶新闻可靠性v0.2基准 得分0.78
RecodeX 重构消息,在50项任务的Newsroom Reliability v0.2基准测试中,SpaceXAI的Grok 4.6以0.78分排名第一。OpenAI的GPT-5.6 Luna Pro以0.77分位居第二,并以每任务0.0005美元的报告成本成为前三中最低。