AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

对齐微调

共 1 条相关 AI 资讯
7月21日
11:38
11:38官方账号arXiv cs.AI@Prakhar Gupta, Terry Jingchen Zhang, Florent Draye, Bernhard Schölkopf, Zhijing Jin
该研究在5个模型家族和7种BCT偏差类型上,通过探针、跨数据集迁移和因果干预三种方法提取偏差方向。发现偏差主要来自对齐微调,预训练基座模型几乎不受影响。每个偏差在隐藏状态中形成一个独立的因果方向,可解码并操控以恢复无偏答案。跨偏差纠缠具有模型特异性,行为相似的偏差占据不同方向。该干预方法能消除大部分偏差错误,同时保留正确回答。
论文对齐微调谄媚线索诱导偏差

推荐理由:这篇论文用五类模型分析了LLM为何容易被提示带偏,发现全是微调惹的祸,每个偏差还有独立方向,能直接修正。
原文
精选全部日报登录