论文官方一手70°21:35Circuit Tracing: 揭示语言模型计算图做 AI 可解释性研究的团队终于有了一个能看清模型内部推理步骤的方法——Circuit Tracing 把黑箱计算拆成了可追踪的图结构,建议关注模型安全的研究者点开看看。#可解释性#计算图#归因图#Anthropic1 个信源在谈事件专题A官方一手Anthropic: Transformer Circuits2 个信源在谈原文稍后读已读值得跟进有用关注 可解释性