AITP
精选全部 AI 动态AI 日报Agent 接入关于更新日志信源提报反馈
登录 / 注册
AITOP
精选
AI 自动挑选的高价值内容
全部模型产品行业论文技巧
标签:运动预测×
5月20日
16:00
arXiv cs.AI@Zhefan Xu, Ghassen Jerfel, Marina Haliem, Qi Zhao, Jeonhyung Kang, Khaled S. Refaat
精选58
本文提出 VL-DPO 框架,利用视觉语言模型(VLM)作为零样本推理器,自动从预训练模型的轨迹输出中生成偏好对,再通过直接偏好优化(DPO)微调运动预测模型,使其与人类驾驶偏好对齐。在 Waymo Open End-to-End Driving Dataset 上实验表明,VLM 的轨迹选择可作为人类偏好的高质量代理,最终模型在评分反馈(RFS)上提升 11.94%,平均位移误差(ADE)降低 10.01%。该方法解决了标准模仿学习难以捕捉人类驾驶偏好细微差异的问题,为自动驾驶行为决策提供了新的对齐思路。
论文自动驾驶偏好对齐视觉语言模型直接偏好优化运动预测

推荐理由:自动驾驶团队终于有了一个自动对齐人类偏好的实用方法——用 VLM 生成偏好对再微调,比手工标注高效太多,做运动预测或决策规划的开发者值得一试。