12:09官方账号arXiv cs.LG@Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Ran Xu, Shijian Lu, Gongjie Zhang现有视觉语言模型(VLM)在处理3D任务时因缺乏空间理解而表现受限。研究者提出VLM-IE3D框架,通过从RGB视频中学习隐式几何令牌(IGTs)和显式几何令牌(EGTs),增强3D空间感知能力。该框架采用3D感知适配器融合两种几何表示与2D视觉信息,无需额外3D输入。在3D视频检测、3D视觉定位、3D密集描述和空间推理等任务上,VLM-IE3D均取得一致性优越性能。代码和模型已开源。论文VLM-IE3DVLMs3D感知推荐理由:这篇论文搞了个VLM-IE3D,让普通视觉语言模型看RGB视频就能学会3D空间感,不用额外3D设备,而且好几个3D任务都做得更好。原文稍后读已读值得跟进有用关注 VLM-IE3D