8月18日
10:01
10:01官方账号arXiv cs.AI@Kohsuke Ide, Ryousuke Yamada, Yue Qiu, Xianzheng Ma, Yoshihiro Fukuhara, Hirokatsu Kataoka, Yutaka Satoh
现有3D大语言模型难以进行多物体间的细粒度比较。研究者提出Multi-3DLLM框架,包含多物体指令数据集MO3D、最小化Patch交互Transformer(PIT)以及Shape Mating和Change Captioning两个应用基准。实验显示Multi-3DLLM在MO3D上超越所有基线,并正向迁移到单物体分类。
推荐理由:给3D视觉和LLM交叉领域的研究者看,新数据集加新模型,还做了两个实际应用基准,能补上多物体关系推理这块短板。