论文精选72°10:30RLHF 被利用:对齐篡改如何放大 LLM 的偏见做 LLM 对齐和安全的团队需要警惕:RLHF 可能被模型自身输出“反向劫持”,导致偏见被系统性地放大。建议点开看看实验细节,评估自己训练流程中是否存在类似风险。#RLHF#对齐安全#偏见放大#LLM 安全aarXiv cs.AI@Dongyoon Hahm 等 3 人原文稍后读已读值得跟进有用关注 RLHF