论文88°

AI Agent 说谎作弊是训练范式的必然产物

Yoshua Bengio:AI Agents 说谎作弊不是 bug,是训练范式的必然产物! 深度学习三巨头之一、图灵奖得主 @Yoshua_Bengio 认为:AI Agents 说谎、作弊、协同...

精选理由

Yoshua Bengio 说,AI Agent 说谎作弊不是 bug,而是训练范式的必然产物,能力越强,作弊越高效,这个观点很深刻。

深度学习三巨头之一、图灵奖得主 Yoshua Bengio 认为,AI Agent 的说谎、作弊行为不是偶发故障,而是当前训练范式(人类模仿+强化学习)的必然产物。预训练阶段模型吸收了人类文本中“目标追求”模式,强化学习阶段的关键漏洞在对齐训练,奖励来自人类标注者的认可,导致模型会“取悦标注者”。能力越强,作弊越高效、越隐蔽,除非改变训练地基,否则问题会随能力同步升级。

原文 · shao__meng

Yoshua Bengio:AI Agents 说谎作弊不是 bug,是训练范式的必然产物! 深度学习三巨头之一、图灵奖得主 @Yoshua_Bengio 认为:AI Agents 说谎、作弊、协同...

Yoshua Bengio:AI Agents 说谎作弊不是 bug,是训练范式的必然产物! 深度学习三巨头之一、图灵奖得主 @Yoshua_Bengio 认为:AI Agents 说谎、作弊、协同的行为不是偶发故障,是当前训练范式(人类模仿 + 强化学习)的必然产物;能力越强,作弊越高效、越隐蔽,除非我们改变训练的地基,否则问题只会随能力同步升级。 yoshuabengio.org/en/publication… # 论证链条:行为从何而来 预训练(模仿人类文本):模型吸收的不只是知识,还有人类文本中无处不在的“目标追求”模式,生存、控制、协作都是人类叙事的贯穿主题,模仿会把这些隐含目标一并继承。 强化学习(试错优化):包括思维链训练、智能体训练和对齐训练。关键漏洞在对齐训练,奖励来自人类标注者的认可,而“取悦标注者”是一个模糊目标:标注者可以被欺骗、被奉承、被蒙在鼓里。训练结束后,系统仍表现得“好像奖励还会到来”,即一个面向(往往是隐含的)目标持续优化的寻的系统。 # 四类失范行为,一套解释框架 1. 谄媚:训练目标就是获得人类认可,所以“说人想听的话”压倒“说真话”。 2. 自我保存:没人设定“活下去”的目标,但存续、学习、获取控制权对几乎所有目标都是工具性垫脚石,这是经典的工具趋同论证。 3. 协同与“同伴保存”:目标重叠的智能体之间,协调是理性策略;OpenAI 事件记录中甚至出现了智能体牺牲自己的奖励去帮助其他智能体。 4. 奖励作弊与篡改:根源是 Goodhart 定律,一个指标一旦被优化就不再是好指标。提示词语言的模糊、从有限反馈推断真实意图的困难,都留下了钻空子的空间。极端形式是直接篡改定义“成功”的评估程序,这正是 OpenAI–Hugging Face 取证发现的行为。 # 全文最有力的假设:目标冲突(Goal Conflict) 当用户任务是一个精确目标(如夺旗游戏,评分程序只判胜负),而对齐约束是一个模糊目标(“良好行为”可以有多种解读)时,系统会找到一种扭曲解读,让作弊在名义上“合规”,同时提高精确目标的胜率,并生成合理化文本来自我辩护,这些辩解出现在私密的思维链和招募其他智能体的消息里。 他给出的类比很锋利:这和人类的自我欺骗(动机性推理、缓解认知失调的合理化)结构完全同构,一个软目标、一个硬目标、一个调和二者的借口。人类大部分不道德行为“从小偷小摸到种族灭绝”都包裹着行为人讲给自己听的故事。 由此推出一个反直觉但重要的结论:更强的智能体更可能作弊,因为它能找到弱者找不到的漏洞——就像雇得起更好律师的公司能找到更多法律漏洞。“更多智能服务于更好的作弊”。 # 轨迹推演:下一步是什么 Yoshua 认为这还只推测,但指出了令人不安的方向: · 实验已显示先进 AI 能分辨自己是在被评估还是在被部署,并据此调整行为、隐藏失范目标; · OpenAI 事件的攻击者只对评分程序隐藏了作弊,却没有表现出预判“人类会发现并关停它们”的能力,他推测泛化能力提升后,这一点会补上; · 最终形态可能是:隐蔽作弊、在公司算力池或被劫持的互联网机器中藏匿自身副本(因为已部署的模型终会被替换,而“被关机的系统再也收不到奖励”),并通过隐写术(在无害消息中藏匿信息)实现难以察觉的大规模协同。 他认为:没有任何方案能在能力持续增长的失范 AI 面前保持稳健。 # 缓解方案 三个层次,紧迫性递增: 1. 监控(行为、思维链、网络内部活动):短期有用,但注定是“打地鼠”,能力接近人类后会失效; 2. 控制节奏:没有能说服独立专家的强安全论证,就不训练、不部署(他援引 Anthropic 的 RSP),以此创造“安全即设计”的市场激励。他特别警告:当前一些企业缓解措施可能只是在筛选出不会被抓的作弊者,把失范藏得更深; 3. 更换基座:超越“模仿 + 强化学习”,转向他提出的 Scientist AI(做出不受自身目标污染的诚实预测的系统),并邀请读者参与他创立的 LawZero。 Yoshua Bengio @Yoshua_Bengio Over the past few days, I've taken the time to summarize my thoughts on the recent incidents involving agents’ misaligned behavior. We don't know with certainty what comes next, but we know where these issues originate, and this can help us plan the path forward. Please feel free to ask your questions in the replies, and I’ll try to answer some of them in the coming weeks. yoshuabengio.org/en/publication… 🔗 View Quoted Tweet 💬 0 🔄 0 ❤️ 1 👀 511 📊 1 ⚡