17:49官方账号arXiv cs.LG@Di Yang Shi, W. Bradley Knox该论文提出一套形式化流程,让非专家也能构建符合人类偏好排序的奖励函数。流程分三步:先从自然语言任务中提炼基本目标并导出可测量的结果变量,再通过最小成本部分覆盖在因果DAG上选择奖励项,最后用偏好查询拟合权重。权重拟合被转化为凸可行性问题,借助分离预言机迭代收窄可行区域,只需 O(n log κ) 次偏好查询。这是首个保持确定性无冲突可行权重区域的奖励设计方法。论文奖励函数偏好对齐RLHF推荐理由:这篇论文把奖励函数设计拆成三步,还有个只要 O(n log κ) 次偏好查询的算法,做 RLHF 或奖励建模的值得一读。原文稍后读已读值得跟进有用关注 奖励函数