论文官方一手85°21:35自然语言自编码器:用文字解释Claude内部状态这项研究让LLM自己说出它的思考过程,做AI安全或模型可解释性的研究者可以直接用这个工具来理解模型行为,比传统探针方法更直观。#可解释性#Claude#自然语言自编码器#AI安全A官方一手Anthropic: Transformer Circuits原文稍后读已读值得跟进有用关注 可解释性