论文09:43
SALT 框架:固定质心按需交换残差,实现高效超低秩 LoRA 服务LoRA 服务老被显存和 PCIe 卡脖子?SALT 用 r≤2 的残差加固定质心,精度追上高秩,vLLM 吞吐最高多 51%。
LoRA 服务老被显存和 PCIe 卡脖子?SALT 用 r≤2 的残差加固定质心,精度追上高秩,vLLM 吞吐最高多 51%。
这篇论文解决了大模型训练资源门槛高的问题——单节点8卡就能训120B模型,做MoE和模型扩展的团队可以直接参考其状态保持原则和TQP策略,省下大量硬件成本。