论文19:12语义奖励崩塌:AI 系统优化导致的不确定性抑制问题这篇论文点出了 RLHF 优化的结构性隐患——模型越优化越不敢说“不知道”,做 AI 安全和对齐的研究者、模型训练工程师值得细读,看完会对当前偏好优化的代价有更深理解。#RLHF/偏好优化#AI安全/对齐#不确定性校准#奖励崩塌aarXiv cs.AI@William Parris原文稍后读已读值得跟进有用关注 RLHF/偏好优化