RecodeX 重构消息,一项名为VA-Bench的基准测试结果显示,大模型在空间智能任务上存在“看懂不等于做对”的执行断层,即模型能够理解空间信息,却难以正确完成相应操作。该测试针对大模型空间智能的理解与执行能力进行了对比评估。