AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

解释评估

共 1 条相关 AI 资讯
7月23日
12:22
12:22官方账号arXiv cs.AI@Hiskias Dingeto
论文指出自然语言自编码器通过重构分数评估解释的忠实性存在缺陷:在Qwen-2.5-7B的口语化器上,约2%的特定主张与重构相关,分数主要反映大意而非具体事实。在合成真值下,标准方法在5/5次运行中产生了共适应私有代码(重构依赖的虚假措辞)。提出两个审计协议(grounded-vs-true交叉和评估器交换)以及RECAP(通过协训练辅助预测器使指定内容可解码)。在RECAP训练的沙盒模型上,新口语化器真实陈述指定内容,代码消失,代价仅+0.001 nat。在预训练的Pythia-160M上,指定内容变得可探针解码,虽新口语化器仅部分传达(真值0.44-0.46 vs 近零对照)。独立探针对口语化器的真实主张评分高于虚假(AUC 0.96 vs 无RECAP 0.82),对抗攻击下RECAP探针仍能识别谎言(AUC 0.95),对照探针降至0.51。
论文Qwen-2.5-7BPythia-160M可解释性

推荐理由:这篇论文揭露了AI解释性评估的漏洞,并给出了RECAP方法,让你知道如何让模型内部信息真正可验证,而非被花言巧语欺骗。
原文
精选全部日报登录