论文10:57面向高效Transformer的互补注意力头剪枝想压缩Transformer模型?CAHP自动剪掉冗余注意力头,不用调参,在SST-5和MNLI上比梯度方法更强,还保住了中间层的关键结构。#CAHP#Transformer#注意力头剪枝#模型压缩aarXiv cs.LG@Yaniv Livertovsky 等 3 人原文稍后读已读值得跟进有用关注 CAHP