事件追踪 · 持续发展中

VA-Bench空间智能评测

持续追踪VA-Bench空间智能评测相关报道与进展。

我的关注 →RSS 订阅
关注仅保存在当前浏览器和域名中,无需登录,不会自动跨设备同步。

事件时间线

按最新发布排序

持续追踪VA-Bench空间智能评测相关报道与进展。

Pandaily中性

大连理工发布VA-Bench:多模态模型机器人任务完成率最高仅53.93%

RecodeX 重构消息,大连理工大学推出VA-Bench评测基准,对12种多模态模型配置在机械臂任务上的表现进行测试。结果显示,Qwen3.8-max以53.93%的成绩领先,但没有任何模型能够完成严格定义的长程任务。

持续追踪VA-Bench空间智能评测相关报道与进展。

VA-Bench基准测试揭示大模型空间智能执行断层

RecodeX 重构消息,一项名为VA-Bench的基准测试结果显示,大模型在空间智能任务上存在“看懂不等于做对”的执行断层,即模型能够理解空间信息,却难以正确完成相应操作。该测试针对大模型空间智能的理解与执行能力进行了对比评估。

更多报道(2)