RecodeX 重构消息,人工智能分析能力测试aa-analystagent近日发布结果,测试含80道题,每道题要求模型独立作答5次,全部答对方可通过。Claude Opus 5以54%的通过率位居第一,GPT-5.5以50%位列第二,Claude Fable 5为49%。开放权重模型中,Kimi K3表现最佳,通过率39%。若按单次平均正确率,GPT-5.5最高(66%),但在连续答对5次的严苛标准下,其通过率降至50%。分析指出,模型常见问题是对题目的理解偏差。