AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

Constitutional Midtraining

共 1 条相关 AI 资讯
7月30日
09:31
09:31官方一手arXiv: Anthropic@Desiree Cho, Cameron Tice, Bernie Hogan, Hunar Batra, Puria Radmard, Jun Zhao, Nigel Shadbolt
精选
研究在120B参数规模上测试了宪法中期训练(constitutional midtraining),使用394M token的宪法语料库(基于Anthropic's Constitution)进行2x2因子设计(curriculum ordering × deliberative reasoning)。与仅回放的对照组相比,宪法中期训练的模型在对齐泛化和持久性上表现更好,尤其在blackmail测试中降低了17.5pp,且优势在良性微调后依然存在。该优势不适用于需要主动抵抗上下文压力的场景,且在SFT后减弱。宪法中期训练对MMLU、ARC-Easy、piqa、GSM8K等能力指标无平均损失。
论文Constitutional MidtrainingAnthropic模型对齐
事件专题

推荐理由:Anthropic提出了在模型训练中期加入宪法性内容来提升对齐持久性,在blackmail任务上降了17.5pp,而且不牺牲MMLU等能力,值得搞对齐的人看看。
原文
精选全部日报登录