23:04官方一手marktechpost@Sana Hassan精选本文提供使用直接偏好优化(DPO)微调语言模型的端到端工作流。教程演示了如何审计 Anthropic HH-RLHF 数据集的结构和长度偏差。它展示了如何使用 TRL 和 LoRA 实现一个稳健的训练管道。最后,文章评估了模型性能,以确保其进行真实的偏好学习,而非依赖词汇捷径。技巧DPOTRLLoRA2 个信源在谈事件专题推荐理由:这篇教程教你用 DPO、TRL 和 LoRA 来微调模型,还教你怎么检查数据里的偏见,比直接用 RLHF 更简单。原文稍后读已读值得跟进有用关注 DPO
10:35官方账号arXiv cs.LG@Ben Anson, Conor Houghton, Edward MilsomMuon 优化器在神经网络预训练中优于常见替代方法,但在 PEFT(参数高效微调)中很少使用。原因在于 LoRA 的低秩参数化无法直接对权重更新做正交化。作者提出 sMuon,通过线性化和最小二乘近似松弛的 Muon 目标,且实现只用 matmul 运算。在 SFT 和 ReLoRA 预训练实验中,sMuon 相比基线有适度性能提升。论文MuonLoRAsMuon推荐理由:Muon 优化器跟 LoRA 本来不搭,这篇论文用数学近似硬凑出了个 sMuon,微调性能有提升,实现还只用矩阵乘法。原文稍后读已读值得跟进有用关注 Muon
19:32官方一手marktechpost@Sana Hassan精选教程展示了基于XYZ-Aquila-SFT和Qwen3搭建工具调用模型微调流程。内容涵盖轨迹解析、结构化工具调用提取以及Qwen兼容的ChatML渲染。最后使用PyTorch实现LoRA高效参数适配。技巧XYZ-Aquila-SFTQwen3微调推荐理由:想自己做工具调用模型?这篇手把手教你用XYZ-Aquila-SFT和Qwen3微调,从数据到LoRA都有。原文稍后读已读值得跟进有用关注 XYZ-Aquila-SFT
11:15官方一手marktechpost@Sana Hassan精选本教程演示了从Hugging Face流式获取SupraLabs推理语料库,并完成质量过滤与数据策展。以SmolLM2-135M-Instruct为基座、LoRA为微调方法,进行监督微调(SFT)并跑通端到端流程。该方案在135M参数规模下验证,无需过多GPU资源即可打造专用推理模型。技巧SupraLabsSmolLM2LoRA推荐理由:教程用SupraLabs语料库+SmolLM2+LoRA,教你在小显卡上微调出推理模型,比追大模型省资源。原文稍后读已读值得跟进有用关注 SupraLabs
18:01官方账号arXiv cs.AI@Rafi Ibn Sultan, Chengyin Li, Yiannos Demetriou, Ahmed I. Ghanem, Joshua P. Kim, Justine Cunningham, Hassan Bagher-Ebadian, Dongxiao Zhu, Kundan S. ThindNA-UNETR是一种基于Transformer的3D分割模型,专门用于自由呼吸非增强CT中左前降支(LAD)动脉的精细分割。该模型在1000个CTA体积上预训练,并通过LoRA在20个CT扫描上微调,使用Dice-Focal与Hausdorff组合损失,经同方差不确定性动态平衡。在内部数据集上,NA-UNETR达到45.64% Dice、38.16 mm HD95和10.01 mm ASD,Dice较nnU-Net提升3.10个百分点,HD95较Swin UNETR降低2.96 mm。在ImageCAS上获得79.49% Dice、8.89 mm HD95和1.02 mm ASD。消融实验证实残差块、可变卷积核和不确定性加权损失均有效。论文NA-UNETRLAD分割医学图像分割推荐理由:放疗圈看过来,这个模型把左前降支动脉分割做得更准,比nnU-Net和Swin UNETR都强,还用了LoRA省显存,值得试试。原文稍后读已读值得跟进有用关注 NA-UNETR
18:39官方一手arXiv: DeepSeek@Liang Zhang, Stephen Hwang, Yue Ma, Jinfa Cai一项研究测试了LoRA监督微调能否提升LLM在数学隐喻编码任务上的表现。研究者使用2,265条6-8年级学生回答,让模型完成效价强度编码和主题编码。对比了GPT-4o mini、GPT-5 mini与DeepSeek-R1 1.5B、Mistral 7B,微调后开源模型性能大幅提升,且与专有模型竞争甚至超越。结果表明紧凑开源模型可支持可扩展、隐私友好的教育测量。论文LoRA微调DeepSeek-R1推荐理由:想知道小模型微调后能不能干过大厂API?这篇用2千多条真实学生数据实测,DeepSeek-R1 1.5B微调后比GPT-5 mini还稳。原文稍后读已读值得跟进有用关注 LoRA
15:59官方账号arXiv cs.AI@Alicia Larsen, Victoire Laurent, Aulia Kharis Rakhamsari, Lara Turgut, Nino Antulov-FantulinV-FiLLM 是一个新的金融推理基准框架,通过可执行计算树在真实表格上生成题目,答案由构造保证正确,无需人工标注。基准提供四个难度控制维度:计算深度、表达式广度、金融概念复杂度和上下文规模。评测显示,推理深度增加时准确率最高下降51%,对抗性数值扰动下下降47个百分点。对开源模型进行轻量 LoRA 微调后,在留出问题上准确率从81.1%提升至85.6%,并在 FinQA 上比基础模型高5个百分点。论文V-FiLLM金融推理基准测试推荐理由:想测金融表格推理?V-FiLLM 用计算树自动生成题目,不用人工标注,还能控制难度,微调后效果提升明显。原文稍后读已读值得跟进有用关注 V-FiLLM
12:39官方账号arXiv cs.LG@Fan Zhang, Jiaming LiRA-FinBERT是一种参数高效框架,将低秩适配(LoRA)与三个连续VADER情感比例及源级元数据特征结合。该设计仅增加1,024个可训练权重,与文本-only FinBERT相比,在金融新闻标题和描述的三分类情感任务上,准确率从63.44%提升至69.89%,宏F1从0.526提升至0.634。中性类召回率从18.18%大幅提升至45.45%。框架支持CPU和GPU执行,适用于计算资源受限场景。论文RA-FinBERTFinBERTLoRA推荐理由:想低成本做金融情感分析?RA-FinBERT用LoRA加规则特征,只加千把个参数就把准确率拉高6个点,中性类召回翻倍,值得看看。原文稍后读已读值得跟进有用关注 RA-FinBERT
11:04官方账号arXiv cs.LG@Xinyi Xu, Bingnan Xiao, Shuang Qin, Gang Feng, Tony Q. S. Quek联邦学习中的LoRA微调通常将更新矩阵分解为A和B两个因子。本文通过最小二乘代理模型分析发现,共享A保留本地B(Share-A/Local-B)要求客户端更新矩阵共享输入侧秩r空间,而共享B保留本地A(Share-B/Local-A)则要求共享输出侧秩r空间,两种策略投影残差不同。据此提出FedAS-LoRA,在训练前用Rank-Aware Shared-Subspace Sufficiency(RSS)指标评估共享子空间充分性,自动选择共享侧。实验覆盖不同任务、数据分布、LoRA秩和参与率设置,验证了RSS有效性和FedAS-LoRA的优越性能。论文LoRA联邦学习FedAS-LoRA推荐理由:联邦学习调LoRA的朋友看这篇,它告诉你A和B该共享哪个,还给了个训练前就能算的指标,省得瞎试。原文稍后读已读值得跟进有用关注 LoRA
10:54官方账号arXiv cs.LG@Peter Lorenz, Anjith George, Marcel Sébastien该研究系统评估了32个基础模型在人脸呈现攻击检测(PAD)中的表现,涵盖不同架构和训练流程。零样本提示在所有模型家族和规模下性能接近随机水平。使用少于1%可训练权重的LoRA低秩适配,多数情况下可实现低于2%的集内ACER,但跨数据集ACER显著更高。研究指出LoRA主要优化集内决策边界,预训练表示和适配数据集对跨数据集泛化的影响大于轻量适配策略。论文LoRA人脸防伪基础模型推荐理由:这篇论文用32个模型实测告诉你,LoRA不是万能药,人脸防伪跨数据集还是得看预训练底子和数据。原文稍后读已读值得跟进有用关注 LoRA
11:55官方账号arXiv cs.LG@Alberto AcedoOmega-S是一个即插即用的惩罚项,仅从权重矩阵计算,无需旧任务数据或Fisher矩阵。在Llama-3-8B上使用LoRA从代码微调到散文的实验中,Omega-S在10个种子中的9个上比无正则化保留更多原始能力。保留率从0.173提升到0.238(pass@1),即从62.9%提升到84.1%,且训练开销增加不到4%。实验表明,其实际生效机制是对节点度方差的正则化,而非名称暗示的拓扑目标。论文还量化了相同配置下保留率的标准差为0.104,并提供了全部代码和逐种子结果。论文Omega-SLlama-3-8BLoRA推荐理由:这篇论文提出了Omega-S,一个只需权重矩阵的正则项,能让微调少忘旧知识,Llama-3-8B上保留率从62.9%提到84.1%,开销只增加4%。原文稍后读已读值得跟进有用关注 Omega-S
11:47官方账号arXiv cs.LG@Pyrros Koussios, Chenhao Li, Xin Chen, Andreas KrauseSAFT是一种自监督方法,通过LoRA适配器利用任务固有结构先验来正则化VLM的潜在空间,无需人工标注即可在线优化奖励信号。在多个基础模型能力范围内测试,SAFT持续降低奖励噪声,加速策略收敛,并使EPIC距离显著改善。研究表明VLM奖励模型的失败多源于结构脆弱性而非语义误解,SAFT为文本条件强化学习提供了可扩展的稳定路径。论文VLMSAFTLoRA推荐理由:SAFT用结构先验替代人工标注,给VLM奖励模型降噪,训练收敛更快,EPIC距离也更好了。原文稍后读已读值得跟进有用关注 VLM
09:43官方账号arXiv cs.LG@Xiang Li, Pengcheng Wang, Huazheng Wang, Saurabh BagchiSALT 提出三阶段分层微调框架:先在域内公共数据上联合训练高容量质心,再用 r≤2 的残差适配器在私有数据上微调,推理时固定质心、按需交换残差。相比 SOTA 压缩基线,该方法在多种 LLM 上取得最高 18.5% 的绝对准确率提升。每适配器显存占用降低至多 16 倍。集成进 vLLM 后,Llama-3.2-3B 的服务器吞吐在 PCIe 带宽压力下提升 51%,在 GPU 显存约束下提升 28%。论文SALTLoRAvLLM推荐理由:LoRA 服务老被显存和 PCIe 卡脖子?SALT 用 r≤2 的残差加固定质心,精度追上高秩,vLLM 吞吐最高多 51%。原文稍后读已读值得跟进有用关注 SALT
11:58官方账号arXiv cs.LG@Tom Saliencro, Rohan Desai, Priya Nair, Maya Lindqvist, Daniel WhitmoreVI-MoLE提出将混合LoRA专家路由视为认证信息价值分配问题。该方法在验证集上为每个专家前缀后的反事实风险输出同时有效的上界证书,并依据单位成本的边际风险降低量分配全局适配器预算。与仅依赖不确定性的动态路由不同,VI-MoLE能区分可恢复风险与残余歧义。论文在匹配计算量准确率、证书覆盖率、风险-覆盖率、分布偏移和尾延迟上与固定及动态MoE-LoRA路由对比。实验设置来自arXiv 2608.02528v1。论文LoRAVI-MoLEMoE推荐理由:这论文把“不确定就多算”的LoRA路由换成了信息价值定价,能证明预算花在哪风险降最多,还带回答弃权判断。原文稍后读已读值得跟进有用关注 LoRA
09:46官方账号arXiv cs.LG@Jiajia Tang, Sizhe Yuen, Francisco Gomez Medina, Yali Du, Adam Sobey参数高效微调(PEFT)通常使用单一共享LoRA适配器,在异构任务序列上会产生干扰和灾难性遗忘。现有方法通过增加参数容量或组合多个适配器来提升表现,但仍依赖共享优化路径。本文提出自动多策略PEFT框架,通过任务分组和排序组织优化路径,采用独立QLoRA实现异构任务解耦优化。在TRACE基准上,该框架在相同可训练容量下达到44.78的最佳性能,验证了优化路径组织比单纯增加适配器容量更有效。论文LoRAQLoRATRACE推荐理由:这篇论文提出用自动任务排序加独立QLoRA来微调LLM,在TRACE基准上拿到44.78,比堆参数容量更管用。原文稍后读已读值得跟进有用关注 LoRA
01:56Fireworks AI@FireworksAI_HQ精选Fireworks AI 在博客中建议,LoRA 表现不佳时先别急着换成更贵的全参数微调。他们用数据覆盖、优化、秩三项低成本测试,看能否缩小 LoRA 与 FullFT 的差距。在 Fireworks 的测试中,有时能缩小差距,有时不能。技巧Fireworks AILoRA全参数微调推荐理由:Fireworks 试了三个便宜测试,看 LoRA 能否追平全参数微调,有时行有时不行。看完就知道先调啥。原文稍后读已读值得跟进有用关注 Fireworks AI
10:10官方一手arXiv: DeepSeek@Ken Ding精选数学推理的RLVR存在盲区:当一组采样全部失败时,GRPO的优势函数为零,导致模型在能力边界提示上无梯度。LSPO在每个RL步检测这类悬崖提示,用其标准答案快速拟合一个小型LoRA适配器,然后重新采样并将成功补全拼回批次。在DeepMath-103K上用DeepSeek-R1-Distill-Qwen-1.5B、n=5配对种子、1000步评估,LSPO在16个(基准,pass@k)组合中15胜1平,AIME24/pass@4提升+10.7点,MATH500/pass@1提升+2.4点,平均提升+3.8点。论文DeepSeek-R1-Distill-Qwen-1.5BGRPOLoRA推荐理由:DeepSeek-R1-Distill-Qwen-1.5B上,LSPO用LoRA支架捡回GRPO在零奖励提示上的梯度,比DAPO平均高3.8个点。原文稍后读已读值得跟进有用关注 DeepSeek-R1-Distill-Qwen-1.5B
11:43官方账号arXiv cs.LG@Tom Saliencro, Rohan Desai, Priya Nair, Maya Lindqvist, Daniel WhitmoreMixture-of-Experts (MoE) LoRA 通常对每个 token 固定激活 k 个专家,但易在简单 token 上浪费计算、难 token 上欠拟合。CARE 利用路由器输出分布作为不确定性信号,以核采样方式按置信度阈值自适应选择专家,且当已选专家分歧时小幅扩展。在 LLaMA-3.1-8B 和 Qwen2.5-7B 的 8 个常识基准、数学、代码和知识任务上,CARE 在相同计算量下优于固定 top-k MoE-LoRA,并能在激活更少专家时匹敌固定 k=4 基线。置信度与分歧信号还提升了 OOD 检测效果,超越 MSP、熵和多遍代理方法。论文CAREMoELoRA推荐理由:MoE-LoRA 不用固定 k 值了,CARE 根据 token 难度自动选专家,在 LLaMA 和 Qwen 上效率更高,还能顺手做 OOD 检测。原文稍后读已读值得跟进有用关注 CARE
09:59官方账号arXiv cs.LG@Madi Makin, Asmaa Abdallah, Abdulkadir Celik, Ahmed M. EltawilWALoMA是一种针对6G无线物理层的多任务基础模型,采用掩码自编码器(MAE)范式从未标记信道数据中学习。它使用2D位置编码保留天线与子载波间空间频率关系,并通过低秩适应(LoRA)实现参数高效微调。在五个下游任务中,WALoMA分别达到96.47%(LoS/NLoS分类)、80.45%(波束预测)、85.78%(信道插值)、99.12%(信道估计)和77.18%(信道映射)。其复合分数87.80%,大幅超越大无线模型(LWM)的59.90%,且仅训练14.68%的总参数。即使在标注数据极端稀缺条件下仍保持强性能。论文WALoMA6GLoRA推荐理由:这篇论文搞了个WALoMA,能用一个模型处理6G多个无线任务,只用少量标注数据就拿到87.8%的平均分,比LWM高了近28个百分点,参数只训练了14%。原文稍后读已读值得跟进有用关注 WALoMA
09:55官方账号arXiv cs.LG@David Demitri Africa, Cate Heine, Nadine Staes-Polet, Kimberly MaiarXiv论文提出通过LoRA权重左上角奇异向量(u1)生成无推理指纹,检测用于生成儿童性虐待材料的LoRA。研究以人类年龄作为CSAM的良性代理,发现u1能识别LoRA训练内容,跨基模型泛化,并对无关良性内容弃权。该信号对权重噪声、重缩放和精度降低具有鲁棒性。结果表明可从权重直接筛查有害LoRA,无需依赖元数据或生成有害输出。论文LoRACSAM图像生成推荐理由:想知道怎么不跑图就能筛出有害LoRA?这篇论文用权重向量做指纹,跨模型都管用,比看元数据靠谱多了。原文稍后读已读值得跟进有用关注 LoRA
10:29Jerry Liu@jerryjliu0Ramp Labs 开源了 PorTAL 框架,用于共享任务表示和跨模型 LoRA 适配。该框架目前支持 Gemma 4 E2B、Mistral 7B 和 Thinky Machines 的 Inkling 模型,覆盖混合注意力模型和多模态系统。代码已在 ramp-public/portallib 仓库中公开,模型托管于 Hugging Face 的 RampPublic 组织。AI模型PorTALRamp LabsLoRA1 个信源在谈事件专题推荐理由:如果你做 LoRA 微调或想用一个框架搞定 Gemma、Mistral 和 Inkling 多个模型的适配,可以看看 Ramp 开源的 PorTAL。原文稍后读已读值得跟进有用关注 PorTAL
09:47官方账号arXiv cs.LG@Peng Xie该论文提出了一种谱分布定律,用于预测LoRA微调中出现的入侵维度(intruder dimensions),即与预训练奇异向量几乎正交的新奇异向量,这些向量会导致灾难性遗忘。通过推导每层临界更新强度s*=θ̄/(γσ₁(BA)),基于矩形尖峰变形变换(rectangular spiked-deformation transform)和精确的谱方程,无需拟合参数即可预测。在涵盖18个适配器、9840层扫描的实验中,该定律在82%的层上将阈值定位在2倍误差内,区分入侵层与非入侵层的平均AUC为0.89。结合两种预定的边缘评估,准确率达98%,并在第三方适配器上验证为0.997。基于阈值推导的尖峰预算规则(spike-budget rule)仅需一次SVD,无需验证扫描,即可在最脆弱的模型上将遗忘减少62%。论文LoRAfine-tuningcatastrophic forgetting推荐理由:这篇论文用数学公式解释了LoRA微调为什么会破坏模型原有知识,而且实验覆盖了9000多层,结果很扎实。如果你做LoRA微调,能帮你预测什么时候会出现遗忘。原文稍后读已读值得跟进有用关注 LoRA
10:56官方账号arXiv cs.LG@Jianghui Wang, Silong Yong, Francesco Orabona, Marco Canini, Katia P. Sycara, Yaqi Xie新方法 κ-LoRA 发现 LoRA 微调中并非所有低秩矩阵都同等重要:条件数(最大与最小奇异值之比)小的矩阵对不同方向已平衡,贡献甚微;条件数大的矩阵包含未充分开发的方向,驱动大部分性能提升。基于此,κ-LoRA 只更新条件数最大的前 50% 权重矩阵,使可训练参数量减半,微调时间平均降低 16.2%,内存开销减少 4.5%,且精度与标准 LoRA 持平。实验表明,被选矩阵的条件数在训练中持续下降,说明方法有效性来自定向谱平衡而非单纯参数选择。AI模型LoRAκ-LoRA条件数推荐理由:如果觉得 LoRA 微调大模型太费钱,κ-LoRA 只挑条件数大的矩阵来更新,参数量砍半,速度提升 16%,精度不降,值得试试。原文稍后读已读值得跟进有用关注 LoRA
10:28官方账号arXiv cs.AI@Federico Boggia论文发现大语言模型系统性过度使用两千年前的修辞格epanorthosis(如“这不是课程,而是蜕变之旅”),归因于训练数据中促销文案和RLHF偏好调优。作者提出Epanorthosis Index(密度与人类基线之比),在三种规模的指令微调模型上测量:或atory场景下模型超用约2倍(意大利语近3倍),非正式问答中欠用,而议论文、新闻和百科文本与人类持平。缓解方案包括轻量LoRA适配器,在意大利语中单行指令即可削减一半至四分之三,SFT适配器可几乎消除。论文LLMRLHFLoRA推荐理由:这篇论文揭示了LLM中一种不易察觉的修辞滥用,并给出了具体测量和缓解方法,适合关注模型文本风格和RLHF影响的读者。原文稍后读已读值得跟进有用关注 LLM
01:13官方账号NVIDIA AI@NVIDIAAI72°NVIDIA AI展示使用PrimeIntellect托管RL训练,将Nemotron 3 Nano在数学任务上的准确率从22%提升至91%,总成本低于5美元。工作流程包括基线检查、奖励训练和重新测试,最终输出可下载的LoRA适配器。该方案可通过修改一行代码扩展至Nemotron 3 Super和Ultra。AI模型Nemotron 3 NanoPrimeIntellectRL6 个信源在谈事件专题推荐理由:花5美元用托管RL把Nemotron 3 Nano的数学准确率从22%拉到91%,还能一键扩展到更大模型,太实用了!原文稍后读已读值得跟进有用关注 Nemotron 3 Nano
14:21官方账号vLLM@vllm_project精选Macaron 团队发布了 Macaron-V1-Venti,一个基于 vLLM 的多 LoRA 路由系统。其开源组件 MoL Harness 可将多个 LoRA 专家模型统一在 OpenAI 兼容端点后,并自动路由请求。该系统利用了 vLLM 原生的 Multi-LoRA 服务。从发布首日即支持 vLLM。AI产品Macaron-V1-VentiMoL HarnessvLLM10 个信源在谈事件专题推荐理由:Macaron 搞了个好东西:把多个 LoRA 模型挂在一个接口后,自动路由,基于 vLLM 直接上线。原文稍后读已读值得跟进有用关注 Macaron-V1-Venti
12:02官方账号arXiv cs.LG@Abigail Woodring, Adrian Chan, Rana Muhammad Shahroz Khan, Sukwon Yun, Chau-Wai Wong, Tianlong Chen论文通过Mistral、Gemma、Qwen三个基础模型的10个连续预训练步骤实验,验证了PortLLM补丁的长期时间可移植性。PortLLM是一种无需训练和数据的自适应方法,仅依赖LoRA补丁移植。理论分析表明,高维向量近正交性是时间可移植性的关键机制。研究还从损失景观几何角度比较了不同自适应选项的优劣。论文PortLLMLoRA微调推荐理由:这篇论文拆穿了为什么PortLLM的补丁隔了好几轮预训练还能用,理论部分用高维空间特性讲得特别清楚。原文稍后读已读值得跟进有用关注 PortLLM
08:52Fireworks AI@FireworksAI_HQ精选MiniMax M3 模型现已可在 Fireworks 上进行训练。用户可通过托管 LoRA SFT 和 DPO 进行标准微调。Fireworks 还提供 Training API,支持自定义 SFT、DPO 和 RL 训练循环,包含检查点、滚动推理和适配器热加载功能。AI模型MiniMax M3FireworksLoRA推荐理由:想 Fine-tune MiniMax M3 的话,Fireworks 现在直接支持 LoRA 和 DPO,还能自定义 RL 训练,省事不少。原文稍后读已读值得跟进有用关注 MiniMax M3
12:12官方一手arXiv: DeepSeek@Martino M. L. Pulici, Cuong Xuan Chu, Evgeny Kharlamov, Zifeng Ding, Volker Tresp, Yunpu Ma精选MADA-RL是一个针对参数≤4B紧凑模型的后训练框架,通过LoRA微调少量参数,将模型分为生成器和评论家角色。其核心是反事实评论家优势:动态基线使评论家优化方向为改进生成器共识而非简单复现正确答案。在五个数学推理基准上,DeepSeek-R1-Distill-Qwen-1.5B模型准确率从39.9%提升至41.9%(+2.0点,p<0.001),可训练参数仅为全微调基线的1/16。该方法接近但未超越使用更大数据集的DeepScaleR和STILL-3,分析表明训练后的评论家更擅长纠正生成器错误。论文MADA-RLDeepSeek-R1-Distill-Qwen-1.5BLoRA推荐理由:小模型也能提升推理?MADA-RL用LoRA微调1/16参数,让1.5B模型准确率涨2个点,评论家专挑生成器错误来纠正。原文稍后读已读值得跟进有用关注 MADA-RL
11:56官方账号arXiv cs.LG@Yi-Ping Chen, Ying-Kuan Tsai, Vispi Karkaria, Seul Lee, Daniel Apley, Wei Chen该论文提出一种自适应数字孪生框架,集成基于Fisher分数的多变量漂移检测器,可实时监测代理模型置信度。在检测到概念漂移时,仅对少于1%的模型参数进行LoRA微调,并采用Mann-Whitney U检验统计验证预测性能提升。在随机线性系统和定向能量沉积增材制造案例中,该框架能快速检测分布偏移并恢复预测精度与不确定性量化。结果表明该方法能为神经网络数字孪生提供统计严谨、计算可行的持续可信保障。论文数字孪生概念漂移LoRA推荐理由:这篇论文解决了数字孪生中模型漂移的老大难问题,用LoRA和统计检验做到实时更新,增材制造案例表现很好。原文稍后读已读值得跟进有用关注 数字孪生
11:49官方账号arXiv cs.LG@Valentijn Oldenburg, Floris de Kam, Bente Zuijdam, Lieve Eberson, Nicky van Zutphen, Stef de Wildt, Ivo Verhoeven该论文提出流形约束超连接(mHC),将残差连接泛化作为新型PEFT方法,在冻结的OLMo-2骨干上学习残差路由模块。实验发现微调时将残差混合矩阵固定为单位阵通常能提升性能。作为独立PEFT方法时mHC未持续优于LoRA,但在匹配可训练参数预算下,mHC+LoRA组合在1B和7B规模上改善了语言建模损失并带来任务相关性基准增益。论文Manifold-Constrained Hyper-ConnectionsLoRAOLMo-2推荐理由:这篇论文把残差连接本身做成了PEFT方法,跟LoRA搭配效果更好,如果你在做模型微调可以看看这个新思路。原文稍后读已读值得跟进有用关注 Manifold-Constrained Hyper-Connections
10:01官方账号arXiv cs.AI@Yunze Han研究者对Qwen2.5-Coder-7B-Instruct模型在SWE-trajectory数据集(67,074条轨迹,32,161条已解决)上进行LoRA微调,提出效率和风格两维度质量评分框架,并通过16组对照实验分析策略、规模与消融。在7B模型SWE-bench解决率近零的情况下,采用交叉熵损失替代评估,发现其与ROUGE-L完全秩相关(Spearman ρ=-1.00)。结果揭示规模依赖的质量-数量权衡:500到1000条时数据翻倍降低约12.7%损失,但TopQ与随机差距小于1%;2000条时差距扩大到3.6%(p=0.016)。消融实验确认错误重试率是主导子维度,表现与完整复合指标相当(Δ<0.2%)。论文Qwen2.5-CoderLoRASWE-trajectory推荐理由:这篇论文系统测试了用SWE-trajectory数据微调Qwen2.5-Coder时,不同轨迹筛选方法的效果,发现数据质量和数量在不同规模下影响不同,值得参考。原文稍后读已读值得跟进有用关注 Qwen2.5-Coder
09:15官方一手marktechpost@Sana Hassan精选该教程展示了如何在Google Colab单GPU上使用NVIDIA NeMo AutoModel微调Qwen3-0.6B模型。从验证CUDA硬件开始,安装NeMo AutoModel源码,加载官方LoRA配置。在受限运行时调整精度、批次大小、检查点和调度器设置。通过automodel CLI启动微调,加载LoRA检查点后比较基础模型与微调输出的差异。最后演示NeMoAutoModelForCausalLM Python API的使用。技巧Qwen3LoRANeMo AutoModel2 个信源在谈事件专题推荐理由:教你用Colab单GPU跑Qwen3-0.6B的LoRA微调,全程实操,从环境配置到API调用都有,适合想上手NeMo的低资源玩家。原文稍后读已读值得跟进有用关注 Qwen3
01:22官方账号NVIDIA AI@NVIDIAAI精选英伟达开源微调库 NeMo AutoModel 新增对 Hugging Face Diffusers 的支持。此前仅限 Transformer 模型,现在可微调图像和视频生成模型。提供即用的全参数和 LoRA 训练脚本,免去手动编写分布式训练代码的繁琐。AI产品AutoModelDiffusers微调推荐理由:英伟达开源微调工具 AutoModel 现在也能调图像视频模型了,提供现成 LoRA 脚本,省去写分布式训练的麻烦。原文稍后读已读值得跟进有用关注 AutoModel
00:10AI Engineer@aiDotEngineer精选在 AIE Europe 会议上,Google DeepMind 团队展示了一个完整微调流程:以 Gemma 270M 模型为起点,通过生成合成任务数据、LoRA 微调、int4 量化,最终部署到 Pixel 手机上。整个流程仅需 21 分钟,准确率从 46% 提升至 90%,推理速度达到 2000 tokens/s。该方法对比 1500 美元的线下 AI 训练营有显著效率和成本优势。技巧GemmaLoRA量化推荐理由:Google 工程师教你怎么在手机上 21 分钟微调一个小模型,从 46% 干到 90%,比花 1500 美元买课还快。原文稍后读已读值得跟进有用关注 Gemma
01:27官方账号NVIDIA AI@NVIDIAAI精选零样本模型漏检了一个可见交通信号。用 LoRA 对 Cosmos 3 Nano 进行后训练后,WTS 验证准确率从 54.41% 提升到 87.14%。结合 NVIDIA TAO AutoML,准确率进一步达到 93.35%。整个微调流程在一天内完成。AI模型NVIDIACosmos 3 NanoLoRA10 个信源在谈事件专题推荐理由:NVIDIA 用 LoRA 微调小模型 Cosmos 3 Nano 做交通信号识别,准确率从 54% 蹿到 93%,一天内搞定,效果很猛。原文稍后读已读值得跟进有用关注 NVIDIA
12:25官方账号arXiv cs.AI@Divya Mereddy, Jeevan Beedareddy该论文提出一种基于低秩适配(LoRA)的级联多模态融合框架,用于医疗培训环境中的动作识别。框架先整合相关性高的模态(如RGB、骨骼),再逐步加入异质模态(如音频),无需重新训练先前组件。在NurViD和Nurse Training两个数据集上评估,级联融合策略优于单模态模型,与先前报告的数据集特定基线(如基于Transformer的方法)性能相当。代码已在GitHub开源。论文LoRA多模态融合动作识别推荐理由:想用LoRA做多模态融合?这篇用级联方式逐步整合不同模态,在医疗动作识别上效果不错,还开源了代码,可以看看。原文稍后读已读值得跟进有用关注 LoRA
08:52官方一手marktechpost@Asif Razzaq精选Thinking Machines Lab发布论文《The Future Worth Building Is Human》,将人类参与和模型所有权纳入技术挑战。论文以Tinker的LoRA微调为例,说明团队可训练并保留自己的模型权重。该方法强调去中心化对齐,允许用户控制模型行为。交互模型被重新设计以支持个性化调整。论文Thinking Machines LabMira MuratiLoRA推荐理由:Mira Murati的新实验室发了篇论文,讲怎么让用户自己掌握模型权重,还拿LoRA举例,挺接地气的。原文稍后读已读值得跟进有用关注 Thinking Machines Lab
11:44官方账号arXiv cs.LG@Shreyas Subramanian, Adewale Akinfaderin, Akarsha Sehwag论文检验了LLM中“超级权重”(单参数移除后性能骤降)的存在性,发现这并非所有模型通用。在OLMo-1B和OLMo-7B上,单独训练100到8192个超级权重参数,精度降至随机猜测水平;即便扩展至周围36000个参数也无改善。相比之下,随机选取同层同等数量参数训练反而能提升基准。使用仅占0.16%参数的vanilla LoRA(更新注意力权重矩阵)成功微调,且施加于超级权重坐标的LoRA约束效果类似。结论指出参数重要性不等同于单独可训练性,有效微调需要基于全层的结构化分解。论文Super WeightLoRAOLMo推荐理由:这篇论文打脸了“超级权重”的主张:单独训练它们反而让模型崩成随机猜,而LoRA用极少的参数就能搞定。想了解模型微调真正该关注什么,必看。原文稍后读已读值得跟进有用关注 Super Weight
12:11官方账号arXiv cs.LG@Fabien Polly该论文提出了一种子空间约束适配方法,在flan-t5-large上使用196个公开LoRA适配器进行评估。实验表明:(1)适配器中30%至38%的权重范数在评价任务分布下是冗余的;(2)在干净分类数据上,限制到128维子空间的梯度适配与全量LoRA性能相当,而在目标标签反转攻击下LoRA精确匹配降至3%-26%,约束学习器保持在62%-96%;(3)约束学习器无法拟合污染数据,适配损失分离干净与脏数据达两个数量级(120倍);(4)针对自适应后门攻击者,当目标行为与池中不相似时攻击成功率仅8% vs LoRA的100%,目标与池中常见行为重合时达85%。代码和数据已公开。论文flan-t5-largeLoRA微调安全推荐理由:这篇论文告诉你一个防止投毒攻击的微调方法:只学有效适配器的子空间,在flan-t5-large上比LoRA安全很多。原文稍后读已读值得跟进有用关注 flan-t5-large