论文中美对照多源确认86°07:44OpenAI研究:RL训练美德,好行为泛化至44项评测OpenAI这篇论文反直觉:用RL教模型做好事,坏行为自己就减少了。实验覆盖44个新场景,效果还抗攻击。值得一看。#OpenAI#RL#涌现失调#对齐10 个信源在谈事件专题orange.ai@oran_ge11 个信源在谈原文稍后读已读值得跟进有用关注 OpenAI