RecodeX 重构消息,何恺明团队推出了一项面向通用人工智能的评测基准,测试结果显示Anthropic的Claude模型取得满分,OpenAI的GPT模型获得99分。该评测旨在以更严苛的标准衡量大模型在AGI相关任务上的能力表现,两项成绩均接近或达到满分水平。