论文11:01UltraQuant:面向上下文密集型智能体的4位KV缓存压缩长上下文智能体推理慢?UltraQuant把4位KV缓存做到实用,延迟降3倍多,吞吐涨1.6倍,值得看看。#UltraQuant#FP4#KV缓存#AMD GPUaarXiv cs.LG@Inesh Chakrabarti 等 7 人原文稍后读已读值得跟进有用关注 UltraQuant