论文精选73°11:17PreferenceEKF 实现高效主动奖励学习PreferenceEKF 用子空间推理解决奖励模型不确定性问题,比传统贝叶斯方法更高效。#PreferenceEKF#RLHF#强化学习#贝叶斯方法官方账号arXiv cs.LG@Yutai Zhou, Erdem Bıyık原文稍后读已读值得跟进有用关注 PreferenceEKF