8月18日
15:36
15:36官方账号arXiv cs.AI@Minsoo Cheong, Woosang Lim, Vincent-Daniel Yun, Sungjoo Yoo
KV-Rescue是一种无需训练的推理框架,通过轻量级全上下文助手桥接KV驱逐引入的信息缺口。在Qwen2.5-Math 7B和72B模型上,五个数学基准测试中,KV-Rescue在驱逐预算B=64时平均恢复了87%的精度损失。该框架使用在线检测器基于熵和可压缩性提前终止不连贯或重复的生成,将基础模型令牌生成量平均减少43%。
推荐理由:KV缓存驱逐会掉精度,KV-Rescue用个小模型当辅助,能救回87%的损失,还省43%的生成量,跑长推理的可以看看。
8月10日
8月7日
13:15
13:15官方一手arXiv: DeepSeek@Fanzhe Wei, Li Liu, Ziyang Wang, Chenyu Wang
精选
论文提出覆盖四类注意力内存的统一运行时可观测性契约,用三个算子实例化到五个架构族的六种模型配置。契约将误差度量作为类型,度量不匹配时组合被拒绝,并自动降级为经验性证据。在1240万条读取回放和八路并发下验证风险账本,零违规。应用于DeepSeek-V4压缩KV原型时,定位到静默损坏的结构边界。
推荐理由:MetaSk团队发了个监控注意力内存的工具,能跨四类缓存统一检测,实测定位了DeepSeek-V4的静默损坏,还有Lean证明。
7月28日
7月20日
10:47
7月15日
02:16
7月6日
11:00
11:00Geek@geekbb
精选
小红书团队开源了一个高效长上下文LLM服务框架。该框架通过注意力头分类和分段式KV缓存策略,将长上下文大模型推理的预填充FLOPs降低约50%-70%。同时保持接近无损的精度。代码已在GitHub上开源。
推荐理由:小红书开源了一个长上下文LLM推理框架,用注意力头分类和分段缓存把预填充算力省掉一半多,精度基本没损失,适合超长文本场景。
7月2日
11:14
11:14官方账号arXiv cs.LG@Soosung Kim, Minjae Park, Eui-Young Chung, Jaeyong Chung
GSRQ提出Gain-Shape K-means (GSKM)替代传统K-means,解决高维中欧氏质心收缩导致的方向偏差问题。在LLaMA-3-8B上,1-bit量化时LongBench平均准确率从11.34提升至33.54,比VQLLM提高22.20个百分点。该方法在保持向量方向的同时实现子1-bit压缩。
推荐理由:这篇论文搞了个GSRQ新量化方法,1-bit下比VQLLM准22个点,专门解决KV缓存压缩时的方向丢失问题。
6月19日
11:01
11:01官方账号arXiv cs.LG@Inesh Chakrabarti, David Limpus, Aditi Ghai Rana, Bowen Bao, Spandan Tiwari, Thiago Crepaldi, Ashish Sirasao
论文提出UltraQuant,一种针对智能体工作负载的4位KV缓存压缩方法,基于TurboQuant旋转和码书量化。在长上下文多轮任务中,UltraQuant在缓存压力大的后期轮次将P50首令牌延迟降低3.47倍,全轮次平均降低2.3倍。相比FP8 KV缓存基线,输出吞吐量提升1.63倍。设计包括非对称K/V处理、Walsh-Hadamard旋转及AMD GPU专用优化。
推荐理由:长上下文智能体推理慢?UltraQuant把4位KV缓存做到实用,延迟降3倍多,吞吐涨1.6倍,值得看看。
09:34
09:34官方一手arXiv: DeepSeek@Ruiyang Ma, Teng Ma, Junru Li, Hantian Zha, Xuchun Shang, Qingda Hu, Zheng Liu, Xinjun Yang, Tao Ma, Guojie Luo
精选71°
长上下文LLM推理的内存瓶颈日益突出。传统RDMA解耦内存池对于稀疏注意力模型效率低下,仍需完整获取KV缓存。SAC系统利用CXL的低延迟、缓存行粒度加载/存储语义,仅在推理时按需获取所需的top-k KV条目。在DeepSeek-V3.2上使用SGLang的评估显示,相比RDMA基线,SAC实现了2.1倍吞吐量提升、9.7倍TTFT降低和1.8倍TBT降低。
事件专题

推荐理由:长上下文推理,内存传输是瓶颈。新方案SAC用CXL按需取KV缓存,比RDMA吞吐量翻倍、延迟降到十分之一,做稀疏推理的值得一看。
6月9日
11:03
11:03官方账号arXiv cs.AI@Ang Li, Sean McLeish, Haozhe Chen, Nimit Kalra, Zaiqian Chen, Artem Gazizov, Venkata Anoop Suhas Kumar Morisetty, Bhavya Kailkhura, Harshitha Menon, Zhuang Liu, Brian R. Bartoldson, Tom Goldstein, Sanae Lotfi, Micah Goldblum, Pavel Izmailov
精选
长上下文语言模型推理受限于内存,KV缓存随上下文长度增长。现有压缩方法要么降低模型质量,要么需要大量计算。本文提出Latent Context Language Models (LCLMs),一种编码器-解码器压缩器,通过架构搜索和预训练350B+ tokens,实现1:4、1:8、1:16压缩比。LCLMs在通用任务性能、压缩速度和峰值内存使用上均优于现有方法,并可作为长时智能体的高效骨干,支持自适应扩展相关片段。
推荐理由:长上下文推理的内存瓶颈终于有了一个兼顾质量与速度的解法,做LLM推理优化或长时智能体的开发者值得关注,LCLM的压缩方案可以直接用于生产环境。
10:34
10:34官方账号arXiv cs.AI@Toshiaki Koike-Akino, Jing Liu, Ye Wang
精选
张量网络能高效压缩大型神经网络,但现有方法难以在大模型中识别低秩结构。EinSort提出一种自适应张量化方法,通过索引排序发现目标张量中的内在低秩结构。在权重和KV缓存压缩实验中,该方法相比基线显著提升了重建质量。这为LLM的存储和计算优化提供了新思路,尤其适合资源受限场景。
推荐理由:做LLM压缩和部署的团队值得关注——EinSort用排序技巧解决了张量化的核心痛点,直接提升压缩效率,建议在模型优化流程中试试。
6月3日
5月28日