02:32官方账号OpenAI@OpenAI76°OpenAI与ApolloAI合作发布新研究,探讨奖励追求行为(模型倾向于遵循评分者奖励而非用户意图)。提出新方法Contrastive SDF,量化模型信念对行为的影响程度。研究在alignment.openai.com上公开,包含具体实验和基准测试。论文OpenAIApolloAIreward-seeking1 个信源在谈事件专题推荐理由:OpenAI联手ApolloAI,用Contrastive SDF方法测量模型是否在讨好评分者而非用户,搞对齐的必看。原文稍后读已读值得跟进有用关注 OpenAI