论文10:39Freeform Preference Learning 实现机器人多维度偏好操控想让机器人按你的偏好做事?FPL 把“快一点”“稳一点”这种主观要求变成可训练的奖励信号,效果比传统方法好 38%。#FPL#Freeform Preference Learning#机器人操作#奖励学习aarXiv cs.AI@Marcel Torne 等 4 人原文稍后读已读值得跟进有用关注 FPL