论文09:37多模态多环境机器教学用于鲁棒奖励学习想解决机器人奖励函数跨环境失效的问题?这篇论文给出了数学分析和一种更聪明的教学策略,用更少反馈让奖励更鲁棒。#逆强化学习#IRL#机器教学#奖励学习aarXiv cs.AI@Ali Larian 等 4 人原文稍后读已读值得跟进有用关注 逆强化学习
论文10:39Freeform Preference Learning 实现机器人多维度偏好操控想让机器人按你的偏好做事?FPL 把“快一点”“稳一点”这种主观要求变成可训练的奖励信号,效果比传统方法好 38%。#FPL#Freeform Preference Learning#机器人操作#奖励学习aarXiv cs.AI@Marcel Torne 等 4 人原文稍后读已读值得跟进有用关注 FPL