12:25
官方一手arXiv: DeepSeek@Junhao Wei, Yanxiao Li, Haochen Li, Yifu Zhao, Dexing Yao, Baili Lu, Zikun Li, Yapeng Wang, Sio-Kei Im, Dingcheng Yang, Xu Yang ARIES-Mission2是一个零样本视觉-语言-动作(VLA)框架,将视觉语义感知与物理路线优化解耦。它用DeepSeek-V3解析自然语言任务,并用Molmo-7B进行零样本目标定位,再通过地理插值将像素坐标转为GPS航点。在UAV-VLPA-nano-30基准上,该框架的飞行距离为62.43公里,比未优化的VLA基线(79.66公里)缩短21.6%,比人工规划(69.00公里)缩短9.5%。30个任务总耗时575.40秒,平均每任务19.18秒,约为人类专家规划速度的3.6倍。其中TSP求解器每任务仅需0.16秒,而VLM推理占据主要耗时。
推荐理由:这个框架让无人机看卫星图就能自动规划路线,比人工规划快3.6倍,飞行距离还缩短近10%,适合大规模任务。