论文官方一手21:35机械论(不)忠实性的玩具模型:transcoder 出错时做 AI 可解释性研究的人会直接受益——这篇论文揭示了 transcoder 可能产生虚假特征的根本原因,看完会对现有方法的可靠性有更清醒的认识。建议所有用稀疏自编码器做模型分析的人点开。#可解释性#transcoder#稀疏自编码器#忠实性1 个信源在谈事件专题A官方一手Anthropic: Transformer Circuits2 个信源在谈原文稍后读已读值得跟进有用关注 可解释性