15:35官方账号arXiv cs.AI@Yiqi Liu, Yang Wang, Songxin Wang, Chenghao Xiao, Chenghua Lin该研究通过受控保留设置,对语言模型拒绝回答时的内部机制进行了因果分析。研究发现,即使模型生成干净拒绝,正确答案仍可从隐藏状态线性恢复。释放被抑制的答案只需单位置补丁,而重新施加抑制则需要跨多个位置的干预。平均答案到拒绝的位移向量不能作为可靠的可逆线性控制开关。这表明拒绝并非简单对称开关,探针可恢复性可能高估真实行为控制能力。论文LLM拒绝机制因果干预推荐理由:这篇论文用因果干预实验拆解了LLM拒绝机制,发现答案释放和拒绝恢复不对称,对AI安全审计很有参考价值。原文稍后读已读值得跟进有用关注 LLM
11:38官方账号arXiv cs.AI@Prakhar Gupta, Terry Jingchen Zhang, Florent Draye, Bernhard Schölkopf, Zhijing Jin该研究在5个模型家族和7种BCT偏差类型上,通过探针、跨数据集迁移和因果干预三种方法提取偏差方向。发现偏差主要来自对齐微调,预训练基座模型几乎不受影响。每个偏差在隐藏状态中形成一个独立的因果方向,可解码并操控以恢复无偏答案。跨偏差纠缠具有模型特异性,行为相似的偏差占据不同方向。该干预方法能消除大部分偏差错误,同时保留正确回答。论文对齐微调谄媚线索诱导偏差推荐理由:这篇论文用五类模型分析了LLM为何容易被提示带偏,发现全是微调惹的祸,每个偏差还有独立方向,能直接修正。原文稍后读已读值得跟进有用关注 对齐微调
11:45官方账号arXiv cs.AI(学术论文)本研究通过押韵对联完成任务,测试语言模型在生成过程中是否存在对结构约束的未来标记的内部规划。使用线性探针和激活补丁方法,在Qwen3、Gemma-3和Llama-3三个系列超过十个规模的模型上进行实验。探针显示所有模型在行边界处都能线性解码未来押韵信息,且信号随规模增强。然而,激活补丁表明只有Gemma-3-27B在因果上依赖此编码,出现从押韵词到行边界的因果驱动转移(约第30层)。其他模型在整个生成过程中持续依赖押韵词,尽管行边界有强探针信号,但因果影响近乎为零。通过两阶段路径补丁,研究成功定位了Gemma-3-27B中负责转移的五个注意力头,恢复了约90%的押韵路由能力。论文语言模型机制理解因果干预推荐理由:该工作揭示了不同语言模型在规划能力上的根本差异:仅部分模型(如Gemma-3-27B)真正依赖内部的前瞻性计划,而其他模型则依赖逐词条件。这对理解模型内部机制和未来设计更可控的生成系统有参考价值。原文稍后读已读值得跟进有用关注 语言模型