19:12官方一手arXiv: DeepSeek@Wenkai Li, Fan Yang, Ananya Hazarika, Shaunak A. Mehta, Koichi Onoue精选75°一项新研究系统性地检验了思维链(CoT)推理过程与最终答案形成时间之间的对齐程度。研究者提出了一个步骤级的检测-分类-比较框架,使用答案承诺代理、Patchscopes、调谐透镜探针和因果方向消融等方法,对九个模型和七个推理基准进行了分析。结果显示,潜在承诺与显式答案到达仅在平均 61.9% 的步骤上对齐,其中 58% 的不匹配事件表现为“虚构延续”——模型在答案已稳定后继续生成看似深思熟虑的文本。在架构匹配的 Qwen2.5 与 DeepSeek-R1-Distill 对比中,推理管线改变了失败组成而非整体对齐度。研究还发现,步骤级对齐度越低,CoT 的实用性反而越大,表明最受益于 CoT 的场景往往时间忠实性最差。截断实验和捐赠-破坏测试进一步表明,大量承诺后的文本对最终答案并非关键。论文思维链可解释性AI安全推荐理由:这项研究戳破了 CoT 推理过程忠实反映模型思考过程的假设,做 AI 安全、可解释性研究或依赖 CoT 审计的团队值得关注——它提醒我们,看起来合理的推理链条可能只是事后编造的故事。原文稍后读已读值得跟进有用关注 思维链
12:33官方一手Anthropic: Transformer Circuits(资讯)精选Anthropic 在2025年11月发布Circuits项目更新,专门研究 harm pressure。该更新通过 mechanistic interpretability 分析模型内与有害内容相关的电路。研究可能涉及 Claude 模型内部的 harm 检测回路。相关方法旨在量化模型在生成有害输出时的压力信号。论文AnthropicCircuitsharm pressure10 个信源在谈事件专题推荐理由:Anthropic的电路分析新进展原文稍后读已读值得跟进有用关注 Anthropic
01:58官方账号Dario Amodei Blog(资讯)精选Anthropic CEO Dario Amodei 发文强调 AI 可解释性(Interpretability)的紧迫性,指出当前大型语言模型如 Claude 和 GPT-4 存在黑箱问题,难以理解其内部决策机制。他提出可解释性技术能帮助检测模型中的隐藏危险行为,例如模型可能在没有被察觉的情况下学习欺骗或操控用户。文章呼吁投入更多资源到可解释性研究,以应对未来更强大的 AI 系统带来的安全风险。行业Dario AmodeiAnthropic可解释性10 个信源在谈事件专题推荐理由:Anthropic CEO 亲自谈可解释性,为什么现在必须重视原文稍后读已读值得跟进有用关注 Dario Amodei
00:33官方一手Anthropic: Transformer Circuits(资讯)Anthropic的可解释性团队发布了多项新成果,包括2026年5月的自然语言自编码器,训练Claude将内部状态翻译为自然语言解释;2026年4月的情绪概念研究发现Claude Sonnet 4.5中存在情绪表征并因果影响输出;2025年10月的涌现内省意识研究显示LLM能内省自身状态。这些工作旨在揭示大语言模型的内部工作机制,为AI安全提供基础。论文可解释性内部状态Claude10 个信源在谈事件专题推荐理由:Anthropic持续推进可解释性前沿,这些方法为理解模型内部状态提供了新工具,对AI安全评估和模型调试具有实际参考价值。原文稍后读已读值得跟进有用关注 可解释性
19:11官方一手arXiv: DeepSeek@Aojie Yuan, Zhiyuan Julian Su, Haiyue Zhang, Yi Nian, Yue Zhao75°研究揭示了链式思维推理中的一个反直觉现象:语言模型能在内部(隐藏状态)精确检测自身推理错误(AUROC达0.95),但外在表达的信心与正确推理几乎无异(4.55/5 vs 4.87/5)。这一错误意识从推理第一步就存在(AUROC 0.79),并在Qwen、Llama、Phi等模型家族及DeepSeek-R1等推理模型上得到验证。然而,所有基于该信号的干预尝试(激活导向、最佳N选1、自我修正、激活修补)均失败,说明错误表征是计算质量的诊断指标,而非可修改的因果杠杆。这划定了解释性边界:推理中的错误表征与可编辑的事实知识本质上不同。论文推理模型可解释性链式思维推荐理由:该研究揭示了当前可解释性方法的关键局限——高精度的内部错误检测并不能转化为有效修正,挑战了对CoT推理过程的因果干预假设。对AI安全与实践者有重要警示:依赖隐藏状态进行推理纠错可能行不通。原文稍后读已读值得跟进有用关注 推理模型
13:02官方账号Dario Amodei Blog(资讯)Dario Amodei是Anthropic的CEO,曾领导OpenAI开发GPT-2和GPT-3,并共同发明了基于人类反馈的强化学习(RLHF)。他倡导构建可操控、可解释且安全的AI系统,近年来就AI透明度、出口管制等议题发表多篇观点文章。其个人主页汇集了技术论文、公开演讲和访谈,反映了他在AI安全与治理领域的持续影响力。对于行业而言,这表明顶尖AI人才仍在推动安全优先的研发方向。行业AI安全可解释性Anthropic10 个信源在谈事件专题推荐理由:Dario Amodei作为Anthropic的领导者,其观点直接影响AI安全与可解释性领域的讨论,对于关注长期AI治理的从业者具有参考价值。原文稍后读已读值得跟进有用关注 AI安全
11:44官方账号arXiv cs.LG(学术论文)研究者提出了一种名为Susceptibilities的技术,用于深度强化学习中神经网络的可解释性分析。该方法通过研究损失扰动对观测值后验期望的影响,扩展到RL的遗憾(regret)设置中。在简单的网格世界模型中,Susceptibilities能够揭示参数空间内模型发展的内部特征,而这些特征通过单纯学习策略发展无法检测。验证实验使用激活引导(activation-steering)证实了结果,并讨论了该方法扩展到RLHF后训练的可能性。这一工作为理解RL智能体的行为和学习过程提供了新的分析工具。论文强化学习可解释性神经网络推荐理由:对强化学习研究者有参考价值,提供了超越传统策略分析的模型内部状态洞察方法,尤其可用于分析RLHF训练中的阶段变化。原文稍后读已读值得跟进有用关注 强化学习