AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

QLoRA

共 4 条相关 AI 资讯
8月3日
09:46
09:46官方账号arXiv cs.LG@Jiajia Tang, Sizhe Yuen, Francisco Gomez Medina, Yali Du, Adam Sobey
参数高效微调(PEFT)通常使用单一共享LoRA适配器,在异构任务序列上会产生干扰和灾难性遗忘。现有方法通过增加参数容量或组合多个适配器来提升表现,但仍依赖共享优化路径。本文提出自动多策略PEFT框架,通过任务分组和排序组织优化路径,采用独立QLoRA实现异构任务解耦优化。在TRACE基准上,该框架在相同可训练容量下达到44.78的最佳性能,验证了优化路径组织比单纯增加适配器容量更有效。
论文LoRAQLoRATRACE

推荐理由:这篇论文提出用自动任务排序加独立QLoRA来微调LLM,在TRACE基准上拿到44.78,比堆参数容量更管用。
原文
7月17日
09:41
09:41官方账号arXiv cs.AI@Vladimir Fedosov, Aleksandr Sazhin, Artemiy Grinenko, Frank Woernle
研究者提出分层全局注意力(HGA),结合分段反向传播和分层KV存储,仅保留当前段在VRAM中可微分,历史KV卸载到RAM或NVMe。在Qwen3-8B上使用4位QLoRA,PG19数据集,16GB Quadro RTX 5000上HGA达到16384训练长度,峰值显存15.28GB,而密集训练仅支持2048令牌。相同适配器可处理131072令牌推理。2K训练长度下,HGA与密集训练困惑度分别为2.7405和2.7383 nat,基线模型为2.9541;HGA训练速度略快(217.75 vs 207.02 tokens/s)。
AI模型Qwen3-8BHGA长上下文

推荐理由:Qwen3-8B长上下文微调显存不够?HGA方案在16GB卡上跑16384令牌,比密集训练省显存还快一点,代码正在路上。
原文
7月10日
09:46
09:46官方一手arXiv: DeepSeek@Vinay Kumar Chaganti
该论文研究将8B推理教师模型deepseek-r1:8b蒸馏为0.6B学生模型Qwen3-0.6B(使用QLoRA,三个随机种子)。学生模型每篇处理时间0.8秒,教师模型需39秒,速度提升约48倍。在摘要质量上,学生模型恢复教师与基线之间58%的差距,比约束解码高16.8分,比少样本提示高4.9分。相同规模的非推理教师(非deepseek-r1)训练的学生表现不优于未经微调的基线,表明摘要提升源于教师的推理特性。推理教师传递写作质量,托管管线传递标签多样性;在22篇短源文章中,指令教师的学生更忠实(74 vs 55篇忠实),而推理系学生易编造内容。
论文deepseek-r1Qwen3-0.6BQLoRA

推荐理由:这篇论文对比了蒸馏不同教师模型的效果,发现推理型教师擅长教写作质量,托管型管线擅长教标签多样性,对选哪种蒸馏方案做端侧部署很有参考价值。
原文
6月3日
08:51
08:51官方一手marktechpost@Sana Hassan
精选
本教程详细介绍了在Google Colab上使用QLoRA和DPO微调LFM2模型的完整步骤。步骤包括使用TRL库进行监督微调(SFT),然后应用DPO算法优化,最后合并适配器。教程提供了可运行的代码和详细解释,适合有基础的用户实践。所有操作在免费的Colab环境下完成。
技巧LFM2QLoRADPO

推荐理由:手把手教你微调LFM2,用Colab免费跑
原文
精选全部日报登录