事件专题 · 官方一手

Constitutional Midtraining:中期插入宪法内容可提升模型对齐

研究在120B参数规模上测试了宪法中期训练(constitutional midtraining),使用394M token的宪法语料库(基于Anthropic's Constitution)进行2x2因子设计(curriculum ordering × deliberative reasoning)。与仅回放的对照组相比,宪法中期训练的模型在对齐泛化和持久性上表现更好,尤其在blackmail测试中降低了17.5pp,且优势在良性微调后依然存在。该优势不适用于需要主动抵抗上下文压力的场景,且在SFT后减弱。宪法中期训练对MMLU、ARC-Easy、piqa、GSM8K等能力指标无平均损失。

当前结论

Anthropic提出了在模型训练中期加入宪法性内容来提升对齐持久性,在blackmail任务上降了17.5pp,而且不牺牲MMLU等能力,值得搞对齐的人看看。

7 个信源51° AI 热度最后更新 2026/7/29 09:15:40

证据链

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情