09:09官方账号arXiv cs.LG@Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron, Emy Gervais精选73°研究显示滑动窗口注意力(SWA)在多个大语言模型的各种下游任务上表现与或优于后训练线性注意力模型。在长上下文推理任务中,SWA性能比线性注意力高2到10倍。SWA无需后训练,速度快且内存需求低。论文Sliding Window AttentionLinear AttentionLLMs推荐理由:SWA比线性注意力更高效,无需后训练就能实现更好性能,内存占用低,推理速度快。原文稍后读已读值得跟进有用关注 Sliding Window Attention