#模型对齐

共 27 条 · 7 天 1 条 · 30 天 10 条
信息流里打上「模型对齐」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月4日
9月17日
9月13日
9月12日
9月10日
9月9日
9月1日
8月29日
8月19日
7月30日
论文多源确认精选09:31
Constitutional Midtraining:中期插入宪法内容可提升模型对齐

Anthropic提出了在模型训练中期加入宪法性内容来提升对齐持久性,在blackmail任务上降了17.5pp,而且不牺牲MMLU等能力,值得搞对齐的人看看。

事件专题
arXiv: Anthropic@Desiree Cho 等 7 人9 个信源在谈原文
7月16日
7月14日
6月11日
6月3日
论文精选10:47
大型推理模型无法忠实表达置信度:新框架量化FC问题

LRM的推理链常被用户视为深思熟虑的证据,但这项研究戳破了这个幻觉——推理行为并不等于置信度表达更可靠。做模型对齐或安全评估的团队值得关注,尤其是那些在医疗、金融等高风险场景部署LRM的开发者,看完会重新审视你的置信度校准策略。

arXiv cs.AI@Areeb Gani 等 4 人原文
6月2日
6月1日
论文精选10:38
VLM在模糊输入下系统性压制女性表征,LALS揭示内部编码与输出脱耦

做AI公平性研究或模型对齐的团队,这篇论文直接戳破了VLM在模糊输入下的性别偏见黑箱——LALS方法让你能逐层看到模型内部编码与输出的脱耦,建议做模型审计的开发者点开看看具体实验设计。

arXiv cs.AI@Arnau Marin-Llobet 等 3 人原文
5月29日
5月21日
5月20日
5月14日
论文精选13:27
人格模型崩溃:微调导致大模型角色分化失控

做AI安全和对齐的研究者、模型微调工程师值得关注——这项研究用两个量化指标揭示了有害微调如何让模型角色扮演能力崩溃,比单纯看输出内容更早发现问题。建议点开看看指标计算方法。

arXiv: DeepSeek@Davi Bastos Costa, Renato Vicente原文