论文09:37多模态多环境机器教学用于鲁棒奖励学习想解决机器人奖励函数跨环境失效的问题?这篇论文给出了数学分析和一种更聪明的教学策略,用更少反馈让奖励更鲁棒。#逆强化学习#IRL#机器教学#奖励学习aarXiv cs.AI@Ali Larian 等 4 人原文稍后读已读值得跟进有用关注 逆强化学习