论文13:26BiasFlow 发布:监测并缓解模型对虚假特征的依赖研究模型偏置的可以看看:arXiv 上的 BiasFlow 同时给了监测质心几何的工具和 BFR 正则项,CelebA 压力测试里 WGA 从 40.7% 拉到 64.1%。#BiasFlow#WGA#模型偏见#研究论文aarXiv cs.AI@Haojin Deng 等 3 人原文稍后读已读值得跟进有用关注 BiasFlow
论文11:33公平性剪枝:通过差分激活定位GLU-MLP层中的人口统计偏见这篇论文教你用剪枝定位偏见:最多剪40个神经元,Llama-3.2-1B能力保住99.49%,但偏见不是消失而是换了方向。#Llama-3.2#Salamandra-2B#模型剪枝#AI安全aarXiv cs.LG@Pere Martra 等 3 人原文稍后读已读值得跟进有用关注 Llama-3.2