主要来源arXiv: Anthropic
查看原文事件专题 · 官方一手
Constitutional Midtraining:中期插入宪法内容可提升模型对齐
研究在120B参数规模上测试了宪法中期训练(constitutional midtraining),使用394M token的宪法语料库(基于Anthropic's Constitution)进行2x2因子设计(curriculum ordering × deliberative reasoning)。与仅回放的对照组相比,宪法中期训练的模型在对齐泛化和持久性上表现更好,尤其在blackmail测试中降低了17.5pp,且优势在良性微调后依然存在。该优势不适用于需要主动抵抗上下文压力的场景,且在SFT后减弱。宪法中期训练对MMLU、ARC-Easy、piqa、GSM8K等能力指标无平均损失。
当前结论
Anthropic提出了在模型训练中期加入宪法性内容来提升对齐持久性,在blackmail任务上降了17.5pp,而且不牺牲MMLU等能力,值得搞对齐的人看看。
7 个信源51° AI 热度最后更新 2026/7/29 09:15:40
证据链
相关来源 1Lenny Rachitsky
查看原文相关来源 2The Rundown AI
查看原文相关来源 3AI Will
查看原文相关来源 4Anthropic
查看原文相关来源 5Yangyi
查看原文相关来源 6elvis
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。