AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

反事实

共 1 条相关 AI 资讯
8月18日
10:16
10:16官方账号arXiv cs.LG@Adam Karvonen, Euan Ong, Subhash Kantamneni, Samuel Marks
CHIVE是一个基于智能体的pipeline,通过反事实提示编辑自动发现并研究LLM在自然场景中的意外行为,生成数千条附带反事实证据的高质量解释。研究人员用它评估多种常见可解释性技术,发现这些技术并未提升代理预测反事实行为的能力。此外,用CHIVE生成的数据训练模型预测反事实结果,能够泛化到多种分布外设置。论文表明CHIVE可自动发现自然发生的LLM行为解释,并为评估和改进解释方法提供新途径。
论文CHIVELLM可解释性

推荐理由:这篇论文搞了个CHIVE自动找模型意外行为,结果发现现有可解释性技术对预测反事实行为没啥用,但用来训练数据倒挺能泛化,值得做可解释性的人看看。
原文
精选全部日报登录