12:06arXiv cs.AI@Yutao Sun, Yanqi Zhang, Li Dong, Jianyong Wang, Furu Wei精选本文提出跨层稀疏注意力(CLSA),一种基于KV共享架构(如YOCO)的新方法。核心创新在于不仅共享KV缓存,还共享路由索引——单个索引器计算一次token级top-k选择,结果跨层复用,既保留了细粒度选择性,又分摊了路由开销。实验显示,在128K上下文下,CLSA实现最高7.6倍解码加速和17.1倍整体吞吐提升,同时保持模型质量。这为长上下文LLM提供了一种兼顾效率与质量的架构方案。论文稀疏注意力长上下文推理加速KV缓存YOCO推荐理由:长上下文推理的瓶颈终于有了系统级解法——CLSA通过共享路由索引同时加速预填充、缓存和解码,做LLM推理优化的团队值得看看这个架构思路。原文