arXiv cs.LG@Gabriel Garcia精选52这篇论文发现,判断Transformer层是否“等价”时,常用的替换测试和交换测试会给出截然不同的结论。替换测试看一层能否替代另一层的位置,交换测试看两层互换后输出是否近似。在Pythia、Qwen3-8B和Llama-3.1-8B等模型上,两种测试的差距从训练初期到收敛逐渐扩大。例如Qwen3-8B在8B规模下,交换测试指导的剪枝比替换测试安全数倍,而Llama-3.1-8B两种测试的剪枝成本却相近。这意味着研究者不能只依赖单一指标判断层冗余,否则可能误判哪些层可以安全剪枝或合并。论文模型压缩层等价性剪枝Qwen3-8BLlama-3.1-8B推荐理由:做模型压缩或剪枝的团队,如果只用一种等价性测试就决定删层,可能会踩坑——这篇论文用Qwen3-8B和Llama-3.1-8B的对比告诉你,测试方法选错,安全剪枝的层数能差好几倍。建议在剪枝前先跑一下两种swap-KL诊断。