论文17:49奖励函数设计框架:从目标到特征到人类对齐这篇论文把奖励函数设计拆成三步,还有个只要 O(n log κ) 次偏好查询的算法,做 RLHF 或奖励建模的值得一读。#奖励函数#偏好对齐#RLHF#因果图aarXiv cs.LG@Di Yang Shi, W. Bradley Knox原文稍后读已读值得跟进有用关注 奖励函数