#LoRA
这篇论文提出了Omega-S,一个只需权重矩阵的正则项,能让微调少忘旧知识,Llama-3-8B上保留率从62.9%提到84.1%,开销只增加4%。
LoRA 服务老被显存和 PCIe 卡脖子?SALT 用 r≤2 的残差加固定质心,精度追上高秩,vLLM 吞吐最高多 51%。
DeepSeek-R1-Distill-Qwen-1.5B上,LSPO用LoRA支架捡回GRPO在零奖励提示上的梯度,比DAPO平均高3.8个点。
MoE-LoRA 不用固定 k 值了,CARE 根据 token 难度自动选专家,在 LLaMA 和 Qwen 上效率更高,还能顺手做 OOD 检测。
这篇论文搞了个WALoMA,能用一个模型处理6G多个无线任务,只用少量标注数据就拿到87.8%的平均分,比LWM高了近28个百分点,参数只训练了14%。
如果你做 LoRA 微调或想用一个框架搞定 Gemma、Mistral 和 Inkling 多个模型的适配,可以看看 Ramp 开源的 PorTAL。
这篇论文用数学公式解释了LoRA微调为什么会破坏模型原有知识,而且实验覆盖了9000多层,结果很扎实。如果你做LoRA微调,能帮你预测什么时候会出现遗忘。
这篇论文揭示了LLM中一种不易察觉的修辞滥用,并给出了具体测量和缓解方法,适合关注模型文本风格和RLHF影响的读者。
花5美元用托管RL把Nemotron 3 Nano的数学准确率从22%拉到91%,还能一键扩展到更大模型,太实用了!
想 Fine-tune MiniMax M3 的话,Fireworks 现在直接支持 LoRA 和 DPO,还能自定义 RL 训练,省事不少。
这篇论文解决了数字孪生中模型漂移的老大难问题,用LoRA和统计检验做到实时更新,增材制造案例表现很好。
这篇论文把残差连接本身做成了PEFT方法,跟LoRA搭配效果更好,如果你在做模型微调可以看看这个新思路。
这篇论文系统测试了用SWE-trajectory数据微调Qwen2.5-Coder时,不同轨迹筛选方法的效果,发现数据质量和数量在不同规模下影响不同,值得参考。
教你用Colab单GPU跑Qwen3-0.6B的LoRA微调,全程实操,从环境配置到API调用都有,适合想上手NeMo的低资源玩家。
英伟达开源微调工具 AutoModel 现在也能调图像视频模型了,提供现成 LoRA 脚本,省去写分布式训练的麻烦。
Google 工程师教你怎么在手机上 21 分钟微调一个小模型,从 46% 干到 90%,比花 1500 美元买课还快。
NVIDIA 用 LoRA 微调小模型 Cosmos 3 Nano 做交通信号识别,准确率从 54% 蹿到 93%,一天内搞定,效果很猛。
Mira Murati的新实验室发了篇论文,讲怎么让用户自己掌握模型权重,还拿LoRA举例,挺接地气的。
这篇论文打脸了“超级权重”的主张:单独训练它们反而让模型崩成随机猜,而LoRA用极少的参数就能搞定。想了解模型微调真正该关注什么,必看。
这篇论文告诉你一个防止投毒攻击的微调方法:只学有效适配器的子空间,在flan-t5-large上比LoRA安全很多。