12:09官方账号arXiv cs.LG@Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Ran Xu, Shijian Lu, Gongjie Zhang现有视觉语言模型(VLM)在处理3D任务时因缺乏空间理解而表现受限。研究者提出VLM-IE3D框架,通过从RGB视频中学习隐式几何令牌(IGTs)和显式几何令牌(EGTs),增强3D空间感知能力。该框架采用3D感知适配器融合两种几何表示与2D视觉信息,无需额外3D输入。在3D视频检测、3D视觉定位、3D密集描述和空间推理等任务上,VLM-IE3D均取得一致性优越性能。代码和模型已开源。论文VLM-IE3DVLMs3D感知推荐理由:这篇论文搞了个VLM-IE3D,让普通视觉语言模型看RGB视频就能学会3D空间感,不用额外3D设备,而且好几个3D任务都做得更好。原文稍后读已读值得跟进有用关注 VLM-IE3D
12:36官方账号arXiv cs.AI@Xuan Han, Yihao Zhao, Mingyu You精选Pose-ICL 是一种无需微调的框架,通过3D感知的上下文学习(ICL)实现姿态可控的主体定制。其核心机制 Surface-Anchored Position Embedding (SAPE) 将图像标记锚定到体积边界框的表面坐标,赋予模型显式的3D感知能力。该方法解决了现有2D模型在主体定制中姿态不准确和跨姿态外观不一致的问题。实验表明,Pose-ICL 在3D资产和真实主体上均显著优于现有方法,在姿态准确性和身份一致性上表现突出。该框架与现有DiT模型兼容,可直接应用。论文主体定制3D感知上下文学习推荐理由:做图像生成和主体定制的团队终于有了一个能精准控制姿态的方案——Pose-ICL 用3D感知解决了2D模型的老大难问题,做定制化生成的开发者可以直接试试。原文稍后读已读值得跟进有用关注 主体定制