论文Agent 与开发者精选73°11:20GoDeep:无标注3D场景理解新方法GoDeep用纯语言模型作为翻译器,实现无标注3D场景理解,能处理OOV对象且结果可解释。#GoDeep#3D场景理解#开放词汇#CLIPaarXiv cs.AI@Thodoris Betsas 等 3 人原文稍后读已读值得跟进有用关注 GoDeep
论文11:29SceneBind: 跨视觉、音频和语言的语义-空间全模态表示SceneBind 把场景的“是什么”和“在哪里”一起建模,场景和空间检索都做到了 SOTA,还能零样本搞定音视频定位。#SceneBind#全模态表示#3D场景理解#跨模态检索aarXiv cs.AI@Mingfei Chen 等 5 人原文稍后读已读值得跟进有用关注 SceneBind
论文10:56OneCanvas: 全景重投影的3D场景理解OneCanvas用全景投影做3D理解,训练少10倍,在SQA3D上SOTA,适合机器人和具身AI。#OneCanvas#SQA3D#VSI-Bench#3D场景理解aarXiv cs.LG@Bartłomiej Baranowski 等 3 人原文稍后读已读值得跟进有用关注 OneCanvas
论文精选11:18PhotoFlow:智能体实现3D虚拟摄影任务做3D场景理解或自动摄影的团队,PhotoFlow 把语言指令到相机参数的全流程打通了,可以直接用它的闭环搜索思路提升自己的渲染管线。#智能体#3D场景理解#虚拟摄影#视觉语言模型aarXiv cs.AI@Jiarui Guo 等 8 人原文稍后读已读值得跟进有用关注 智能体