论文09:43RaBitQCache:面向长上下文LLM推理的旋转二进制量化KV缓存RaBitQCache用旋转二进制量化KV缓存,比现有稀疏注意力方法更快更省内存,还能自适应调整预算。#RaBitQCache#旋转二进制量化#KV缓存#长上下文aarXiv cs.LG@Wenhao Li 等 6 人原文稍后读已读值得跟进有用关注 RaBitQCache