8月31日
09:09
09:09官方账号arXiv cs.LG@Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron, Emy Gervais
精选73°
研究显示滑动窗口注意力(SWA)在多个大语言模型的各种下游任务上表现与或优于后训练线性注意力模型。在长上下文推理任务中,SWA性能比线性注意力高2到10倍。SWA无需后训练,速度快且内存需求低。
推荐理由:SWA比线性注意力更高效,无需后训练就能实现更好性能,内存占用低,推理速度快。