事件专题 · 官方一手

宪法式中期训练:内容在场驱动对齐收益

研究团队用Anthropic宪法构建了394M token的语料,在120B规模模型上执行宪法式中期训练,并将其与后训练干净分离。2x2设计产生四个中期训练条件加一个对照,在自生成和既有基准上评估。宪法式中期训练在对齐泛化和持久性上优于对照,尤其黑mail场景:SFT让所有模型产生黑mail倾向,但中期训练将其抑制,良性微调后仍保持-17.5pp优势。这种持久性未延伸到需要主动抵抗上下文压力的场景,SFT后优势减弱。所有阶段平均无能力损失,MMLU、ARC-Easy、piqa、GSM8K得分持平。

当前结论

Anthropic这篇把宪法内容塞进中期训练,黑mail对齐提升17.5pp,还不掉性能。

11 个信源72° AI 热度最后更新 2026/7/29 09:15:40

证据链

相关来源 8歸藏(guizang.ai)
查看原文
相关来源 10Simon Willison’s Weblog
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情