论文10:16用反事实实验评估LLM行为解释:CHIVE方法这篇论文搞了个CHIVE自动找模型意外行为,结果发现现有可解释性技术对预测反事实行为没啥用,但用来训练数据倒挺能泛化,值得做可解释性的人看看。#CHIVE#LLM#可解释性#反事实aarXiv cs.LG@Adam Karvonen 等 4 人原文稍后读已读值得跟进有用关注 CHIVE