Anthropic 的 Claude Opus 5 在 ARC-AGI-3 智能基准测试中得分 30.2%,是 GPT-5.6 Sol 此前记录(7.8%)的近四倍,且模型自主提出反射方程,展现更强的逻辑推理。