论文72°12:05Move the Query, Not the Cache:跨实例 MLA 注意力新策略做大规模 LLM 推理部署的团队,这篇论文给出了跨 GPU 注意力优化的新思路——路由查询而非移动缓存,实测能大幅降低延迟。建议关注其成本模型和决策谓词,可直接用于优化自家推理系统。#注意力机制#MLA#跨实例推理#GPU 集群aarXiv: DeepSeek@Bole Ma 等 4 人原文稍后读已读值得跟进有用关注 注意力机制