10:14官方账号arXiv cs.LG@Thomas Mbrice, Ammar Ali, Sami Mian, Khai Hern Low, Eric Chen, Arshia Aghajani, Wolf Schäfer, Amin Shirangi该论文提出伦理决策头(EDH),在CARLA仿真环境中用深度强化学习训练自动驾驶汽车的道德决策。模型通过PPO算法优化,奖励函数来自Bradley-Terry模型,基于200个碰撞临近场景的人工偏好标注。结果显示康德式规则条件训练稳定,但功利主义模型学到的是人类评分者更偏好自我牺牲,而非真正最小化伤亡。论文据此认为RLHF学到的不是哲学家定义的伦理,而是人类实际偏好的行为模式。论文自动驾驶RLHFPPO推荐理由:这篇论文把电车难题做成了奖励函数,用200个碰撞场景让AI学真实偏好,结果还挺反直觉。原文稍后读已读值得跟进有用关注 自动驾驶