论文10:14LEMUR:用偏好反馈实现多目标强化学习对齐这是篇新论文,LEMUR能直接从多人偏好学多目标策略,不用设奖励函数,基准上比现有方法强。#LEMUR#多目标强化学习#偏好反馈#强化学习aarXiv cs.AI@Manith Adikari 等 4 人原文稍后读已读值得跟进有用关注 LEMUR
论文10:01基于偏好反馈的核MDP学习:理论分析与遗憾界偏好反馈是 RLHF 的核心,但理论分析一直稀缺。这篇论文把核 MDP 和偏好学习结合,给出了亚线性遗憾界,做理论强化学习或 RLHF 算法设计的研究者值得细读。#强化学习#偏好反馈#RLHF#核MDPaarXiv cs.LG@Nikola Pavlovic 等 3 人原文稍后读已读值得跟进有用关注 强化学习