论文12:46因果审计揭示神经元选择器在拒绝行为中的忠诚度与局限性这篇论文直接检验了神经元归因方法的可靠性,发现高秩稳定的选择器反而可能因果失效,对模型可解释性和安全编辑很有启发。#neuron selectors#attribution methods#LLM#模型可解释性aarXiv cs.LG@Ananth Eswar 等 4 人原文稍后读已读值得跟进有用关注 neuron selectors