7月27日
11:56
11:56官方账号arXiv cs.AI@Yifei Zhao, Xiangxin Zhou, Wenhao Yang, Jiaqi Tang, Pu Jian, Huanjin Yao, Jiarui Yao, Haowei Lin, Chunchao Guo, Zhuo Chen, Wenkai Lyu, Jianzhu Ma, Xueqian Wang, Wenxi Zhu
SceneActBench 是一个评估视觉语言模型(VLM)代理在3D场景中行动能力的基准,包含5个任务,覆盖210个源实例和520个任务案例。每个任务在统一的代理-环境循环中运行,使用任务特定的几何指标评估最终输出。在11个专有VLM配置上测试,总体得分范围为38.6到50.2,没有任何配置在所有任务上表现一致。论文分析了失败模式,指出当前模型在多对象3D场景中的行动能力仍有显著不足。
推荐理由:想测测视觉语言模型能不能真在3D空间里干活?SceneActBench给你5个任务、520个案例,开源又公平,看哪个模型分高。