7月3日
04:03
04:03Stanford AI Lab@StanfordAILab
精选
斯坦福AI实验室提出Freeform Preference Learning方法,让标注者用自然语言描述轨迹的偏好轴(如速度、精度、子任务完成度),而非仅做单一整体偏好选择。该方法学习基于这些轴的奖励函数,能提取更优策略。论文arXiv:2606.32027和博客已公开。
推荐理由:斯坦福团队发了个新方法,让标注者用自然语言描述偏好,比单一打分更精确,机器人策略能学到更多结构信息。