小米 MiMo 团队发布 HySparse2 注意力架构
小米 MiMo 团队搞了个新注意力架构,1M 上下文时 prefill 计算量和 KV cache 都砍到原来的几分之一,长文检索分数还涨了,做长上下文部署的可以看看论文。
小米 MiMo 团队搞了个新注意力架构,1M 上下文时 prefill 计算量和 KV cache 都砍到原来的几分之一,长文检索分数还涨了,做长上下文部署的可以看看论文。
小米 LLM-Core 团队搞了个 HySparse2 稀疏注意力,1M token 预填充计算量降约 5 倍,做长上下文的可以看看。