论文11:36VLM-PBRS:用视觉语言模型自动进行势能奖励塑形这论文教你用VLM给RL智能体自动设计奖励函数,不用手动调公式,在Meta-World和Franka Kitchen上训练更快,还防奖励黑客。#VLM-PBRS#强化学习#奖励塑形#Meta-WorldaarXiv cs.AI@Henrik Müller, Daniel Kudenko原文稍后读已读值得跟进有用关注 VLM-PBRS
论文10:57UBP2:基于不确定性平衡的偏好规划提升强化学习样本效率UBP2通过主动探索和不确定性平衡,有效解决了偏好强化学习中样本效率低的问题。在Meta-World测试中效果显著。#UBP2#偏好强化学习#样本效率#Meta-WorldaarXiv cs.LG@Mohamed Nabail 等 4 人原文稍后读已读值得跟进有用关注 UBP2