09:43官方账号arXiv cs.LG@Xiang Li, Pengcheng Wang, Huazheng Wang, Saurabh BagchiSALT 提出三阶段分层微调框架:先在域内公共数据上联合训练高容量质心,再用 r≤2 的残差适配器在私有数据上微调,推理时固定质心、按需交换残差。相比 SOTA 压缩基线,该方法在多种 LLM 上取得最高 18.5% 的绝对准确率提升。每适配器显存占用降低至多 16 倍。集成进 vLLM 后,Llama-3.2-3B 的服务器吞吐在 PCIe 带宽压力下提升 51%,在 GPU 显存约束下提升 28%。论文SALTLoRAvLLM推荐理由:LoRA 服务老被显存和 PCIe 卡脖子?SALT 用 r≤2 的残差加固定质心,精度追上高秩,vLLM 吞吐最高多 51%。原文稍后读已读值得跟进有用关注 SALT