11:29官方账号arXiv cs.AI@Mingfei Chen, Zijun Cui, Ruoke Zhang, Hyeonggon Ryu, Eli ShlizermanSceneBind 是一种全模态表示方法,通过联合语义和 3D 空间理解来建模真实场景。它使用全局语义嵌入与对象中心语义-空间槽,显式编码对象级语义、空间属性和不确定性。SceneBind Matching 方案整合全局场景相似性与对象对齐,支持跨模态场景检索和对象定位。在场景检索和空间检索基准上达到 SOTA,并在音频-视觉定位任务上实现零样本迁移。论文SceneBind全模态表示3D场景理解推荐理由:SceneBind 把场景的“是什么”和“在哪里”一起建模,场景和空间检索都做到了 SOTA,还能零样本搞定音视频定位。原文稍后读已读值得跟进有用关注 SceneBind
10:56官方账号arXiv cs.LG@Bartłomiej Baranowski, Dave Zhenyu Chen, Matthias NießnerOneCanvas将多视角patch特征投影到等距柱状全景画布,并添加3D坐标的位置嵌入。无需复杂几何编码器或大量训练预算。在SQA3D和VSI-Bench上达到SOTA准确率,在SPBench上泛化到分布外数据。训练计算量比最强竞争方法少一个数量级。论文OneCanvasSQA3DVSI-Bench推荐理由:OneCanvas用全景投影做3D理解,训练少10倍,在SQA3D上SOTA,适合机器人和具身AI。原文稍后读已读值得跟进有用关注 OneCanvas
11:18官方账号arXiv cs.AI@Jiarui Guo, Haojia Wei, Yiming Zhang, Yifei Liu, Yuning Gong, Hongjie Zhang, Xue Yang, Zhihang Zhong精选PhotoFlow 提出了一种基于智能体的虚拟摄影框架,能够在无预设相机位姿或参考图像的情况下,根据语言指令在3D场景中自动选择相机参数并渲染照片。该框架包含导演、评审和反思三个模块,通过闭环搜索优化拍摄效果。同时发布了 VPhotoBench 基准,包含47个场景和141个语言条件摄影任务。实验表明,PhotoFlow 在六轮渲染预算下,成功率和质量对齐指标均优于现有方法。这是首个将语言条件虚拟摄影作为可执行智能体任务的工作。论文智能体3D场景理解虚拟摄影推荐理由:做3D场景理解或自动摄影的团队,PhotoFlow 把语言指令到相机参数的全流程打通了,可以直接用它的闭环搜索思路提升自己的渲染管线。原文稍后读已读值得跟进有用关注 智能体