论文精选16:00VL-DPO:视觉语言引导的偏好对齐自动驾驶微调框架自动驾驶团队终于有了一个自动对齐人类偏好的实用方法——用 VLM 生成偏好对再微调,比手工标注高效太多,做运动预测或决策规划的开发者值得一试。#自动驾驶#偏好对齐#视觉语言模型#直接偏好优化aarXiv cs.AI@Zhefan Xu 等 6 人原文稍后读已读值得跟进有用关注 自动驾驶