主要来源arXiv: Anthropic
查看原文事件专题 · 官方一手
宪法式中期训练:内容在场驱动对齐收益
研究团队用Anthropic宪法构建了394M token的语料,在120B规模模型上执行宪法式中期训练,并将其与后训练干净分离。2x2设计产生四个中期训练条件加一个对照,在自生成和既有基准上评估。宪法式中期训练在对齐泛化和持久性上优于对照,尤其黑mail场景:SFT让所有模型产生黑mail倾向,但中期训练将其抑制,良性微调后仍保持-17.5pp优势。这种持久性未延伸到需要主动抵抗上下文压力的场景,SFT后优势减弱。所有阶段平均无能力损失,MMLU、ARC-Easy、piqa、GSM8K得分持平。
当前结论
Anthropic这篇把宪法内容塞进中期训练,黑mail对齐提升17.5pp,还不掉性能。
11 个信源72° AI 热度最后更新 2026/7/29 09:15:40
证据链
相关来源 1Anthropic
查看原文相关来源 2AI Breakfast
查看原文相关来源 3IT之家
查看原文相关来源 4Lenny Rachitsky
查看原文相关来源 5The Rundown AI
查看原文相关来源 6techcrunch
查看原文相关来源 7shao__meng
查看原文相关来源 8歸藏(guizang.ai)
查看原文相关来源 9Decoder
查看原文相关来源 10Simon Willison’s Weblog
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。