论文Agent 与开发者71°21:09OpenBMB推出扩散奖励模型DRMOpenBMB发DRM模型,不再把人类偏好压缩成单一分数,能保留分歧和不确定性,还能提升奖励决策可靠性。#DRM#OpenBMB#奖励模型#RLHFOpenBMB@OpenBMB原文稍后读已读值得跟进有用关注 DRM