论文10:47PagedWeight:面向MoE大模型服务的高效动态质量感知权重量化这篇论文展示了PagedWeight方法,能在MoE模型服务里动态量化权重,省内存还保准,比之前的方法效果明显更好。#MoE#LLM推理#权重量化#KV缓存aarXiv cs.LG@Yuchen Yang 等 4 人原文稍后读已读值得跟进有用关注 MoE
论文精选13:27高率量化矩阵乘法 II:水填充法优化LLM量化做LLM量化的开发者终于有了理论指导——水填充法比均匀分配更优,GPTQ加随机旋转就能接近极限,建议做权重量化的团队点开看看具体实现。#量化#LLM#水填充法#GPTQaarXiv cs.AI@Or Ordentlich, Yury Polyanskiy原文稍后读已读值得跟进有用关注 量化