论文10:01基于偏好反馈的核MDP学习:理论分析与遗憾界偏好反馈是 RLHF 的核心,但理论分析一直稀缺。这篇论文把核 MDP 和偏好学习结合,给出了亚线性遗憾界,做理论强化学习或 RLHF 算法设计的研究者值得细读。#强化学习#偏好反馈#RLHF#核MDPaarXiv cs.LG@Nikola Pavlovic 等 3 人原文稍后读已读值得跟进有用关注 强化学习