AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

SALT

共 1 条相关 AI 资讯
8月5日
09:43
09:43官方账号arXiv cs.LG@Xiang Li, Pengcheng Wang, Huazheng Wang, Saurabh Bagchi
SALT 提出三阶段分层微调框架:先在域内公共数据上联合训练高容量质心,再用 r≤2 的残差适配器在私有数据上微调,推理时固定质心、按需交换残差。相比 SOTA 压缩基线,该方法在多种 LLM 上取得最高 18.5% 的绝对准确率提升。每适配器显存占用降低至多 16 倍。集成进 vLLM 后,Llama-3.2-3B 的服务器吞吐在 PCIe 带宽压力下提升 51%,在 GPU 显存约束下提升 28%。
论文SALTLoRAvLLM

推荐理由:LoRA 服务老被显存和 PCIe 卡脖子?SALT 用 r≤2 的残差加固定质心,精度追上高秩,vLLM 吞吐最高多 51%。
原文
精选全部日报登录