论文10:57UBP2:基于不确定性平衡的偏好规划提升强化学习样本效率UBP2通过主动探索和不确定性平衡,有效解决了偏好强化学习中样本效率低的问题。在Meta-World测试中效果显著。#UBP2#偏好强化学习#样本效率#Meta-WorldaarXiv cs.LG@Mohamed Nabail 等 4 人原文稍后读已读值得跟进有用关注 UBP2