层等价性测试方法不同，结果天差地别：Qwen3-8B和Llama-3.1-8B案例

精选理由

做模型压缩或剪枝的团队，如果只用一种等价性测试就决定删层，可能会踩坑——这篇论文用Qwen3-8B和Llama-3.1-8B的对比告诉你，测试方法选错，安全剪枝的层数能差好几倍。建议在剪枝前先跑一下两种swap-KL诊断。

AI 摘要

这篇论文发现，判断Transformer层是否“等价”时，常用的替换测试和交换测试会给出截然不同的结论。替换测试看一层能否替代另一层的位置，交换测试看两层互换后输出是否近似。在Pythia、Qwen3-8B和Llama-3.1-8B等模型上，两种测试的差距从训练初期到收敛逐渐扩大。例如Qwen3-8B在8B规模下，交换测试指导的剪枝比替换测试安全数倍，而Llama-3.1-8B两种测试的剪枝成本却相近。这意味着研究者不能只依赖单一指标判断层冗余，否则可能误判哪些层可以安全剪枝或合并。

AI 翻译 · 中文

arXiv cs.LGWhen researchers ask whether two transformer layers are "equivalent" for compression, they often conflate distinct tests. Replacement asks whether one layer's map can substitute for another's in place; interchange asks w…

阅读原文