10:09官方账号arXiv cs.AI@Wenyuan Xie, Shaokai Wu, Yijin Zhou, Yanbiao Ji, Guodong Zhang, Bayram Bayramli, Qiuchang Li, Xunchu Zhou, Yue Ding, Hongtao LuMVP-Nav提出一种物理感知的RGB-only导航框架,利用3D基础模型将单目图像的2D语义实例投影为3D有向包围盒,重建显式物理占用空间。该方法通过多层价值图(MVM)将语义优先级与重建几何整合到共享成本空间,实现了语义推理与物理约束的统一。在零样本目标导航基准上,MVP-Nav显著优于现有无深度方法,达到最先进性能。论文MVP-Nav零样本目标导航3D基础模型推荐理由:MVP-Nav让机器人只用普通摄像头就能安全导航,它用3D基础模型理解空间,比之前纯语义方法更安全。原文稍后读已读值得跟进有用关注 MVP-Nav
13:39官方账号arXiv cs.AI@Liyao Wang, Ruipu Wu, Haojun Xu, Lei Shi, Linjiang Huang, Si Liu现有跨视角目标地理定位方法依赖2D外观匹配,受限于缺少几何元数据的数据集。研究者提出GAGeo框架,基于置换等变3D基础模型π³,在单次前向传播中联合预测边界框、分割掩码和相机位姿。新构建的GeoTerra数据集包含超过22万对地面-卫星和无人机-卫星图像,提供多模态提示(点、框、蒙版)和相机位姿。引入的对比损失利用卫星视图作为通用锚点,实现零样本地面到无人机定位。实验表明该方法在未见场景和新型跨视角设置中显著优于现有方法。论文GAGeoGeoTerra跨视角定位推荐理由:想搞跨视角目标定位?这篇论文用GAGeo和22万对数据集解决了2D匹配的局限,还能零样本从地面转到无人机视角。原文稍后读已读值得跟进有用关注 GAGeo