论文10:14自动驾驶伦理决策头:用RLHF将道德规范转化为奖励信号这篇论文把电车难题做成了奖励函数,用200个碰撞场景让AI学真实偏好,结果还挺反直觉。#自动驾驶#RLHF#PPO#CARLAaarXiv cs.LG@Thomas Mbrice 等 8 人原文稍后读已读值得跟进有用关注 自动驾驶