大连理工发布VA-Bench:多模态模型机器人任务完成率最高仅53.93%
RecodeX 重构消息,大连理工大学推出VA-Bench评测基准,对12种多模态模型配置在机械臂任务上的表现进行测试。结果显示,Qwen3.8-max以53.93%的成绩领先,但没有任何模型能够完成严格定义的长程任务。
持续追踪VA-Bench空间智能评测相关报道与进展。
关注仅保存在当前浏览器和域名中,无需登录,不会自动跨设备同步。RecodeX 重构消息,大连理工大学推出VA-Bench评测基准,对12种多模态模型配置在机械臂任务上的表现进行测试。结果显示,Qwen3.8-max以53.93%的成绩领先,但没有任何模型能够完成严格定义的长程任务。
RecodeX 重构消息,一项名为VA-Bench的基准测试结果显示,大模型在空间智能任务上存在“看懂不等于做对”的执行断层,即模型能够理解空间信息,却难以正确完成相应操作。该测试针对大模型空间智能的理解与执行能力进行了对比评估。