论文12:49Self-Pruned Key-Value Attention:让LLM只保留未来有用的记忆KV缓存是长上下文推理的瓶颈,这篇论文用自学习剪枝解决了内存爆炸问题,做LLM推理优化或长文本应用的开发者可以直接参考其方法。#KV缓存#长上下文#注意力机制#模型压缩rohanpaul_ai@rohanpaul_ai原文稍后读已读值得跟进有用关注 KV缓存