09:29官方账号arXiv cs.LG@Xiaotian Zhang, Lai Shun Chan, Yue Shang, Entao Yang, Ge Zhang一篇来自arXiv的论文研究了高熵解对模型鲁棒性的影响。作者以模算术中的grokking为受控场景,对比AdamW训练的Transformer与基于Wang-Landau分子动力学采样的高熵模型。噪声注入实验显示,AdamW模型在强制记忆随机标签后,原任务测试准确率从100%跌至75%以下,而高熵模型仍保持约95%。通过奇异值分解发现,高熵网络在注意力层和MLP层具有更高的有效秩,可缓冲灾难性遗忘。论文GrokkingAdamWWang-Landau推荐理由:这篇论文用模算术实验揭穿了一个幻觉:模型泛化好不代表扛得住后续干扰。高熵模型比AdamW更抗遗忘,想了解训练鲁棒性的可以看看。原文稍后读已读值得跟进有用关注 Grokking