№preference·general
Preference
别名
- 首次出现
- 2026-05-22
- 最近出现
- 2026-07-27
- 累计提及
- 47
§ 01综述
Preference 在人工智能领域通常指人类或系统对某些输出、行为或策略的偏好倾向,是强化学习、机器人操控和生成模型等方向的关键信号。近期研究集中在如何以更灵活、高效的方式获取和利用偏好信息,推动模型向更符合人类意图的方向优化。
Preference 学习近期进展
Freeform Preference Learning:用自然语言描述偏好轴改进机器人策略
Stanford AI Lab 提出 Freeform Preference Learning,允许用户通过自然语言定义偏好的多个维度(如“更平稳”或“更快”),从而让机器人策略在多个目标之间灵活权衡。这种方法减少了对人工标注的依赖,提升了泛化能力。 原文标题
FAR: 失败感知重试框架实现测试时恢复与持续策略改进
该框架通过识别机器人执行中的失败模式并触发重试,同时利用偏好反馈持续优化策略。它强调在部署阶段根据实时偏好调整行为,而非仅依赖离线训练数据。 原文标题
Freeform Preference Learning 实现机器人多维度偏好操控
同一团队在 arXiv 上详细阐述了 Freeform Preference Learning 的技术细节,展示了如何用对比学习对齐自然语言偏好描述与机器人动作,使偏好控制更加直观和高效。 原文标题
DrPO:一步生成模型偏好优化的新方法
DrPO 将偏好优化引入一步生成模型(如扩散模型),通过直接优化偏好目标而非间接奖励建模,提升了生成图像或文本的质量与用户满意度。 原文标题
当前焦点与观察点
当前 Preference 研究的核心焦点在于从“如何获取高质量偏好信号”转向“如何以人类直觉的方式表达偏好并融入模型”。Freeform Preference Learning 代表了从数值评分到语言描述的范式转变,降低了偏好标注的门槛。同时,如何在不依赖大量演示数据的情况下,通过测试时反馈(如 FAR 框架)持续改进策略,成为实用化的重要方向。此外,生成模型中的偏好优化(如 DrPO)显示出在图像生成等领域的潜力,但如何避免偏好过拟合与保持多样性仍是争议点。整体来看,Preference 的灵活性与可控性是驱动下一代 AI 系统的关键,但鲁棒性与可扩展性仍需进一步验证。