11:03官方账号arXiv cs.LG@Gyuwan Kim, Cheoneum Park, Tao YangCoinRAG是一种针对长上下文检索增强生成(RAG)的KV缓存复用优化方法,通过两阶段检索识别查询相关的语义单元,并组合复用其切片KV表示,避免处理冗长检索上下文。在LongBench多跳问答任务上,CoinRAG相比基线实现了新的帕累托前沿,在标准快速预填充延迟预算下平均F1相对提升5.3%,同时显著降低运营成本。该方法将粗粒度块级缓存细化为语义碎块级,减少了信息冗余与噪声。论文CoinRAGRAGKV缓存推荐理由:想给RAG省算力又不想掉精度?CoinRAG把检索结果拆成小碎块做缓存复用,LongBench上F1平均提了5.3%,值得一看。原文稍后读已读值得跟进有用关注 CoinRAG