论文11:41CrossPool:分离 KV-Cache 和权重的冷 MoE 模型多 LLM 服务引擎这篇论文提出了 CrossPool,通过分离权重和 KV-cache 池,能大幅降低冷 MoE 模型的推理延迟,比现有系统快 10 倍以上。#CrossPool#MoE#KV-cache#推理模型aarXiv cs.LG@Zhuoren Ye 等 7 人原文稍后读已读值得跟进有用关注 CrossPool