论文11:22ELSAA:用于Transformer训练的高效低秩稀疏注意力近似这篇论文把稀疏和低秩两种思路拧在一起,解决Transformer的长序列瓶颈。不用算完整的注意力矩阵,就能同时抓住局部和全局信息。#ELSAA#Transformer#注意力机制#长上下文aarXiv cs.AI@Mahdi Heidari 等 3 人原文稍后读已读值得跟进有用关注 ELSAA