论文09:06论文:数据归因估计结果不一致,根源在于反事实规范差异做数据归因或模型调试的朋友可以看看,它解释了为什么不同影响力估计方法排序对不上,还给出对齐行为规范的具体做法。#数据归因#LLM#影响函数aarXiv cs.LG@Zhe Li 等 4 人原文稍后读已读值得跟进有用关注 数据归因
论文精选73°11:43从重加权到重写:解锁训练数据归因中样本的干预效果研究人员发现影响函数选中的样本通过重写而非重加权能更有效改变模型行为,这对训练数据归因方法评估有重要启示。#训练数据归因#影响函数#开源大模型#干预效果aarXiv cs.LG@Yuzhang Luo 等 4 人原文稍后读已读值得跟进有用关注 训练数据归因
论文精选10:51多样性可检测性:单次运行隐私审计的改进金丝雀生成方法做隐私审计或差分隐私研究的团队,这篇论文直接解决了单次运行审计中金丝雀干扰的痛点,提出的方法计算效率高且效果更好,值得点开看具体实现。#隐私审计#差分隐私#金丝雀生成#双层优化aarXiv cs.LG@Mathieu Dagréou, Aurélien Bellet原文稍后读已读值得跟进有用关注 隐私审计