主要来源arXiv: DeepSeek
查看原文事件专题 ·官方一手
一种无需重新训练的模型知识移除方法
本文提出了一种名为ARIA的新方法,它通过稀疏自编码器在测试时移除大语言模型中的特定知识,而不修改模型权重。该方法在DeepSeek-R1和Gemma-3等模型上进行了测试,在TOFU、R-TOFU和WMDP等基准测试中,成功减少了WMDP-cyber基准的遗忘集准确率,同时保持了MMLU基准的得分仅下降1%以内。
当前结论
这个方法挺有意思,不用改模型权重就能移除特定知识,在DeepSeek和Gemma上效果还不错,感兴趣的可以看看。
2 个信源44° AI 热度最后更新 2026/9/14 18:58:09
证据链
2 个信源相关来源 1量子位
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。