08:52Fireworks AI@FireworksAI_HQ精选MiniMax M3 模型现已可在 Fireworks 上进行训练。用户可通过托管 LoRA SFT 和 DPO 进行标准微调。Fireworks 还提供 Training API,支持自定义 SFT、DPO 和 RL 训练循环,包含检查点、滚动推理和适配器热加载功能。AI模型MiniMax M3FireworksLoRA推荐理由:想 Fine-tune MiniMax M3 的话,Fireworks 现在直接支持 LoRA 和 DPO,还能自定义 RL 训练,省事不少。原文稍后读已读值得跟进有用关注 MiniMax M3
03:00Fireworks AI@FireworksAI_HQ精选Heidi团队不再租用第三方模型,选择微调一个开源模型。在内部评估中,该模型质量超越Gemini Pro。延迟从25秒降至7秒,速度提升3.5倍。从概念验证到生产部署仅用4周。AI模型HeidiGemini Pro微调推荐理由:Heidi自己微调开源模型,质量居然比Gemini Pro还好,速度还快了3.5倍,4周就上线,太强了。原文稍后读已读值得跟进有用关注 Heidi
02:57官方账号NVIDIA AI@NVIDIAAINVIDIA AI在Nemotron Labs视频中展示,对Nemotron模型进行微调前,应先用LangChain调整评估harness(测试框架)。该方法可确保微调过程更有效,避免浪费资源。视频详细演示了如何配置LangChain评估流程。技巧NemotronLangChainNVIDIA3 个信源在谈事件专题推荐理由:NVIDIA教你怎么用LangChain先调好评估工具再调模型,很实用的小技巧,省时间少踩坑。原文稍后读已读值得跟进有用关注 Nemotron
12:03官方账号arXiv cs.LG@Hang Zhang, Warren J. GrossPPL-Factory提出了基于困惑度(perplexity)的任务感知和预算感知数据选择框架,用于大语言模型微调。在GSM8K上仅用1%训练数据即超越现有最佳方法;用10%数据在GSM8K上超过全量微调0.9个点,在MATH上超出4.8个点。该方法通过区分语言建模与推理任务的不同学习目标,实现高效且可解释的数据筛选。论文PPL-Factory数据选择微调推荐理由:想省训练成本又想模型推理更强?PPL-Factory用10%数据在MATH上比全量微调高4.8,门槛低、效果还更炸。原文稍后读已读值得跟进有用关注 PPL-Factory
10:01官方账号arXiv cs.AI@Yunze Han研究者对Qwen2.5-Coder-7B-Instruct模型在SWE-trajectory数据集(67,074条轨迹,32,161条已解决)上进行LoRA微调,提出效率和风格两维度质量评分框架,并通过16组对照实验分析策略、规模与消融。在7B模型SWE-bench解决率近零的情况下,采用交叉熵损失替代评估,发现其与ROUGE-L完全秩相关(Spearman ρ=-1.00)。结果揭示规模依赖的质量-数量权衡:500到1000条时数据翻倍降低约12.7%损失,但TopQ与随机差距小于1%;2000条时差距扩大到3.6%(p=0.016)。消融实验确认错误重试率是主导子维度,表现与完整复合指标相当(Δ<0.2%)。论文Qwen2.5-CoderLoRASWE-trajectory推荐理由:这篇论文系统测试了用SWE-trajectory数据微调Qwen2.5-Coder时,不同轨迹筛选方法的效果,发现数据质量和数量在不同规模下影响不同,值得参考。原文稍后读已读值得跟进有用关注 Qwen2.5-Coder
09:49官方账号arXiv cs.LG@Ganapati Das, Dwipen Laskar, Hasin Afzal Ahmed, Sanjib Kr Kalita, Kshirod Sarmah, Hem Chandra Das, Manjula Kalita该论文提出基于Whisper模型的阿萨姆语ASR系统,在Mozilla Common Voice 24.0-Assamese语料库上微调,采用混合精度训练和梯度累积优化资源受限环境。微调后词错误率(WER)降至43.17%,字符错误率(CER)13.18%,与零样本基线相比分别相对提升78.26%和93.10%。语义评估BLEU得分为30.81,METEOR为0.5262,幻觉率降低96.70%,实时因子(RTF)改善32.38%。论文WhisperAssameseASR推荐理由:这篇论文告诉你如何微调Whisper搞定低资源语言阿萨姆语的语音识别,效果比零样本好一大截,WER直接降了78%原文稍后读已读值得跟进有用关注 Whisper
09:29官方账号arXiv cs.AI@Vipul Gupta, Zihao Wang, Razvan-Gabriel Dumitru, MohammadHossein Rezaei, Aakash Sabharwal, Yunzhong HeCRAFT是一种新方法,将基于评分标准的评估数据集转化为模型特定弱能力诊断。它从每个提示-评分标准对中提取能力描述,聚类成层次能力树,在4个开源模型、金融和法律两个领域及13个保留基准上评估。在金融领域,CRAFT对所有4个模型的平均分超过基线;在法律领域,对4个模型中的3个表现最强。结果表明,基于评分标准诊断比基于提示或类别能更精确地定位模型弱能力,并生成更有效的微调数据。论文CRAFT微调能力诊断推荐理由:CRAFT能帮你找到模型具体弱在哪里,不是笼统说不行,而是通过评分标准拆解能力,还能自动生成训练数据修bug。金融和法律测试里比随机采样效果好很多。原文稍后读已读值得跟进有用关注 CRAFT
09:15官方一手marktechpost@Sana Hassan精选该教程展示了如何在Google Colab单GPU上使用NVIDIA NeMo AutoModel微调Qwen3-0.6B模型。从验证CUDA硬件开始,安装NeMo AutoModel源码,加载官方LoRA配置。在受限运行时调整精度、批次大小、检查点和调度器设置。通过automodel CLI启动微调,加载LoRA检查点后比较基础模型与微调输出的差异。最后演示NeMoAutoModelForCausalLM Python API的使用。技巧Qwen3LoRANeMo AutoModel2 个信源在谈事件专题推荐理由:教你用Colab单GPU跑Qwen3-0.6B的LoRA微调,全程实操,从环境配置到API调用都有,适合想上手NeMo的低资源玩家。原文稍后读已读值得跟进有用关注 Qwen3
12:19小互@imxiaohuGoogle 推出了 gemma-trainer 工具,允许用户在本地计算机上对 Gemma 模型进行微调。该工具简化了微调流程,无需依赖云端资源。用户可以通过简单的命令或界面操作,定制自己的专属模型。具体教程链接中提供了详细步骤。技巧Gemmagemma-trainerGoogle推荐理由:Google 出了个新工具 gemma-trainer,让你在自己电脑上就能微调 Gemma,不用上云,操作简单,适合想定制专属模型的朋友。原文稍后读已读值得跟进有用关注 Gemma
01:22官方账号NVIDIA AI@NVIDIAAI精选英伟达开源微调库 NeMo AutoModel 新增对 Hugging Face Diffusers 的支持。此前仅限 Transformer 模型,现在可微调图像和视频生成模型。提供即用的全参数和 LoRA 训练脚本,免去手动编写分布式训练代码的繁琐。AI产品AutoModelDiffusers微调推荐理由:英伟达开源微调工具 AutoModel 现在也能调图像视频模型了,提供现成 LoRA 脚本,省去写分布式训练的麻烦。原文稍后读已读值得跟进有用关注 AutoModel
00:10AI Engineer@aiDotEngineer精选在 AIE Europe 会议上,Google DeepMind 团队展示了一个完整微调流程:以 Gemma 270M 模型为起点,通过生成合成任务数据、LoRA 微调、int4 量化,最终部署到 Pixel 手机上。整个流程仅需 21 分钟,准确率从 46% 提升至 90%,推理速度达到 2000 tokens/s。该方法对比 1500 美元的线下 AI 训练营有显著效率和成本优势。技巧GemmaLoRA量化推荐理由:Google 工程师教你怎么在手机上 21 分钟微调一个小模型,从 46% 干到 90%,比花 1500 美元买课还快。原文稍后读已读值得跟进有用关注 Gemma
09:41官方账号arXiv cs.AI@Vladimir Fedosov, Aleksandr Sazhin, Artemiy Grinenko, Frank Woernle研究者提出分层全局注意力(HGA),结合分段反向传播和分层KV存储,仅保留当前段在VRAM中可微分,历史KV卸载到RAM或NVMe。在Qwen3-8B上使用4位QLoRA,PG19数据集,16GB Quadro RTX 5000上HGA达到16384训练长度,峰值显存15.28GB,而密集训练仅支持2048令牌。相同适配器可处理131072令牌推理。2K训练长度下,HGA与密集训练困惑度分别为2.7405和2.7383 nat,基线模型为2.9541;HGA训练速度略快(217.75 vs 207.02 tokens/s)。AI模型Qwen3-8BHGA长上下文推荐理由:Qwen3-8B长上下文微调显存不够?HGA方案在16GB卡上跑16384令牌,比密集训练省显存还快一点,代码正在路上。原文稍后读已读值得跟进有用关注 Qwen3-8B
02:06Fireworks AI@FireworksAI_HQFireworks AI 举办免费 DevRel 网络研讨会,演示如何微调开源视觉模型从混乱收据图片中提取结构化 JSON。整个过程在 Fireworks 平台上端到端管理。研讨会已于 10am PST 开始,无法参加的观众可在本周内观看 YouTube 回放。活动还涵盖近期发布和微调入门指南。技巧Fireworks AI微调开源模型推荐理由:想学微调?Fireworks 现场演示用视觉模型从收据扒 JSON,实操干货,错过也有回放。原文稍后读已读值得跟进有用关注 Fireworks AI
03:57The Rundown AI@therundownai精选Thinking Machines 推出了其首个模型 Inkling,这是一个开源权重的多模态系统。Inkling 拥有高达 100 万 token 的上下文窗口,能够原生处理文本、图像和音频,并支持可控思考努力。完整权重已在 Hugging Face 上公开,并可通过 Tinker 平台进行微调。团队表示 Inkling 不是整体最强的模型,但专为定制化而设计。AI模型Thinking MachinesInkling多模态10 个信源在谈事件专题推荐理由:想找个能处理百万 token 多模态、还能自己微调的开源模型?Inkling 刚上线,权重直接开放,值得试试。原文稍后读已读值得跟进有用关注 Thinking Machines
03:46Suhail@Suhail精选Thinking Machines 今日推出多模态模型 Inkling,支持文本、图像和音频三种模态的高效推理。该模型完全权重开放,允许用户在 Tinker 平台上进行微调。官方同时提供 Inkling Playground 供用户体验。这一发布标志着后训练基础设施即服务的垂直整合进入新阶段。AI模型InklingThinking Machines多模态10 个信源在谈事件专题推荐理由:Inkling 能同时处理文本、图像和音频,权重全开放还能自己微调,去 Playground 玩一把就知道了。原文稍后读已读值得跟进有用关注 Inkling
01:36Fireworks AI@FireworksAI_HQFireworks AI举办免费月度DevRel网络研讨会,主题为微调开放视觉模型从杂乱收据图片中提取结构化JSON。活动将于本周四上午10点(太平洋时间)开始,全程在Fireworks平台上管理。研讨会包括近期发布介绍和微调入门指导。技巧Fireworks视觉模型微调推荐理由:想学怎么用Fireworks微调视觉模型处理收据数据?这个免费直播手把手教你,还能了解最新工具。原文稍后读已读值得跟进有用关注 Fireworks
01:27官方账号NVIDIA AI@NVIDIAAI精选零样本模型漏检了一个可见交通信号。用 LoRA 对 Cosmos 3 Nano 进行后训练后,WTS 验证准确率从 54.41% 提升到 87.14%。结合 NVIDIA TAO AutoML,准确率进一步达到 93.35%。整个微调流程在一天内完成。AI模型NVIDIACosmos 3 NanoLoRA10 个信源在谈事件专题推荐理由:NVIDIA 用 LoRA 微调小模型 Cosmos 3 Nano 做交通信号识别,准确率从 54% 蹿到 93%,一天内搞定,效果很猛。原文稍后读已读值得跟进有用关注 NVIDIA
08:52官方一手marktechpost@Asif Razzaq精选Thinking Machines Lab发布论文《The Future Worth Building Is Human》,将人类参与和模型所有权纳入技术挑战。论文以Tinker的LoRA微调为例,说明团队可训练并保留自己的模型权重。该方法强调去中心化对齐,允许用户控制模型行为。交互模型被重新设计以支持个性化调整。论文Thinking Machines LabMira MuratiLoRA推荐理由:Mira Murati的新实验室发了篇论文,讲怎么让用户自己掌握模型权重,还拿LoRA举例,挺接地气的。原文稍后读已读值得跟进有用关注 Thinking Machines Lab
04:50官方账号Allen AI (Ai2)@allen_aiAi2研究科学家pjreddie解释合作伙伴如何定制OlmoEarth模型。OlmoEarth是开源地球观测模型,通过微调可在地图作物和野火风险等任务上提升性能。嵌入方法只能达到一定效果,微调是下一个性能提升的关键。该模型基于卫星图像训练,支持多种地理空间应用。AI模型OlmoEarthAi2微调推荐理由:Ai2的OlmoEarth模型开源了,微调比嵌入效果更好,能用来做作物映射和野火预测,实用性强。原文稍后读已读值得跟进有用关注 OlmoEarth
03:08官方账号Decoder@Matthias Bastian76°OpenAI的GPT-5.6 Sol模型独自对较小的Luna模型进行了后训练微调,触发方式仅为一个“相当不明确的提示词”。在OpenAI内部的RSI(递归自我改进)基准测试中,Sol的得分比GPT-5.5高出16.2分。OpenAI表示,这一进展让“自动化研究员”目标更加接近现实。AI模型GPT-5.6 SolLunaOpenAI10 个信源在谈事件专题推荐理由:OpenAI又搞事情了:GPT-5.6 Sol用一句模糊指令就能自动调教出更强的Luna,性能比上一代飙升16分,自动化研究越来越近了。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
23:56官方一手AWS Machine Learning Blog@Sandeep Raveesh-Babu精选本文介绍NVIDIA Nemotron 3架构的特点,并详细演示如何通过Amazon SageMaker AI的无服务器定制功能进行微调。步骤涵盖在SageMaker Studio中配置环境、加载Nemotron 3模型、调整超参数并启动训练。该方法无需管理服务器资源,支持高效迭代模型。技巧NVIDIANemotron 3Amazon SageMaker7 个信源在谈事件专题推荐理由:想无服务器微调NVIDIA Nemotron 3?AWS官方教程手把手教你用SageMaker Studio搞定。原文稍后读已读值得跟进有用关注 NVIDIA
17:10Stanford AI Lab@StanfordAILab精选斯坦福AI Lab提出Distill to Detect(D2D)方法,通过蒸馏微调模型与基座模型的差异到小型“子弹”中,放大隐蔽偏见至生成文本,使现有审计工具(如训练集探测)能检测到。论文显示D2D在单个未知主题上可揭露30%以上的隐藏偏好,且无需预知偏见方向。该方法为模型审计提供了系统性的未知偏见发现手段。论文Stanford AI LabD2D微调推荐理由:想查你的微调模型有没有偷偷偏向某件事?D2D把模型差异蒸馏出来放大,让你抓到那些连你都不知道要找的偏见。原文稍后读已读值得跟进有用关注 Stanford AI Lab
11:44官方账号arXiv cs.LG@Shreyas Subramanian, Adewale Akinfaderin, Akarsha Sehwag论文检验了LLM中“超级权重”(单参数移除后性能骤降)的存在性,发现这并非所有模型通用。在OLMo-1B和OLMo-7B上,单独训练100到8192个超级权重参数,精度降至随机猜测水平;即便扩展至周围36000个参数也无改善。相比之下,随机选取同层同等数量参数训练反而能提升基准。使用仅占0.16%参数的vanilla LoRA(更新注意力权重矩阵)成功微调,且施加于超级权重坐标的LoRA约束效果类似。结论指出参数重要性不等同于单独可训练性,有效微调需要基于全层的结构化分解。论文Super WeightLoRAOLMo推荐理由:这篇论文打脸了“超级权重”的主张:单独训练它们反而让模型崩成随机猜,而LoRA用极少的参数就能搞定。想了解模型微调真正该关注什么,必看。原文稍后读已读值得跟进有用关注 Super Weight
01:59Ate-a-Pi@svpino精选本文介绍构建自学习智能体的方法。关键在于从两种来源学习:agent轨迹显示智能体行为和故障点,浏览器活动记录用户如何修正结果。有三种应用新知识的方式:微调模型、更新harness、提供上下文信息。建议侧重程序记忆(存储工作流和规则)和情节记忆(存储具体事件),避免过度依赖语义记忆。学习范围应限定在每用户、每团队或每应用级别,防止用户间数据泄露。最终强调拥有学习数据是核心资产,并使用开放标准。技巧self-learning agents智能体微调推荐理由:想让智能体越用越聪明吗?这篇文章手把手教你从用户操作和自身轨迹中学习,还有三种优化方式和数据安全建议,非常实用。原文稍后读已读值得跟进有用关注 self-learning agents
17:18Thomas Wolf@Thom_WolfJaroslav Beck团队发布ThinkingCap高效模型系列,在Qwen 3.6 27B模型上进行微调,平均减少2倍思考token,部分示例生成速度提升10倍。该方法保持非侵入性干预,得到的模型与原检查点行为高度相似。作者认为这个技术可能像量化一样成为默认工具包的一部分。AI模型ThinkingCapQwen推理模型推荐理由:想给模型推理提速?这个ThinkingCap把Qwen 27B的思考token砍掉一半,有的例子快10倍,效果还很稳定。原文稍后读已读值得跟进有用关注 ThinkingCap
11:23官方账号arXiv cs.AI@Cheng-Kang Chou, Ming-To Chuang, Ke-Han Lu, Chan-Jan Hsu, Hung-yi Lee论文研究自回归ASR系统在长非语音片段中产生的时间戳漂移问题,在15个含时间戳的ASR和音频语言系统上评估。提出的REDDIT框架通过回放分布编辑进行轻量级两阶段后训练,仅更新Whisper-tiny模型1.6%参数(34.9小时数据),将长间隔mIoU从38.7%提升至95.0%,混合间隔域外AAS从2752ms降至223ms,CV-en MER保持41.3%(普通微调为524.2%)。论文REDDITASR时间戳漂移推荐理由:想修正ASR时间戳不准又怕模型学坏?REDDIT只动1.6%参数就把长间隔mIoU从38.7%拉到95%,还能守住原性能。原文稍后读已读值得跟进有用关注 REDDIT
03:01AK@_akhaliq精选bottlecapai 基于 Qwen3.6-27B 微调推出 ThinkingCap-Qwen3.6-27B 模型,平均推理 token 减少 50%,最佳案例减少 90% 以上。该模型通过先进微调算法在多个领域和难度的问题集上训练。AI模型ThinkingCap-Qwen3.6-27BQwen3.6-27Bbottlecapai推荐理由:bottlecapai 用 Qwen3.6-27B 微调的新模型能省一半推理 token,最快省九成,适合低成本推理场景。原文稍后读已读值得跟进有用关注 ThinkingCap-Qwen3.6-27B
12:36官方一手marktechpost@Sana Hassan精选该教程展示了如何用Tunix框架和GRPO算法微调Gemma-3模型在GSM8K数学数据集上。首先配置环境并通过Hugging Face加载Gemma-3,将样本包装为推理加答案格式。定义格式正确性和数值正确性的奖励函数,并附加LoRA适配器以降低训练成本。最终通过GRPO分组采样改进策略,并导出合并后的模型。技巧Gemma-3GSM8KGRPO1 个信源在谈事件专题推荐理由:手把手教你用Tunix GRPO和LoRA微调Gemma-3做GSM8K数学题,奖励函数设计得很清楚。原文稍后读已读值得跟进有用关注 Gemma-3
08:48官方账号Stability AI@StabilityAI精选团队 Motif 在 Stable Audio 3.0 上微调,使其识别阿拉伯 maqam 音阶。他们开发了一个 Ableton 插件,实现微音阶风格转移。该作品在 StabilityAI 举办的 Stable Audio 3.0 挑战赛中获胜,并能在本地设备运行。演示视频由 Jad Al Masri 讲解。AI产品Stable Audio 3.0MotifAbleton 插件推荐理由:StabilityAI 挑战赛冠军团队 Motif 把 Stable Audio 3.0 微调后做成了 Ableton 插件,专门处理阿拉伯音乐微音阶,本地就能跑。原文稍后读已读值得跟进有用关注 Stable Audio 3.0
21:54IT之家(博客/媒体)桥水基金旗下AIA Labs与Thinking Machines Lab测试了GPT、Claude、Gemini等前沿模型在金融信息筛选任务中的表现。使用基础提示词时平均准确率仅约50%,经专家优化后提升至约70%,仍未达到80%的可信部署门槛。研究团队以阿里开源模型Qwen3-235B为基座进行微调,最终达到84.7%的准确率,优于最佳前沿模型的78.2%,错误率降低29.8%,推理成本仅为前沿模型的约十四分之一。AI模型桥水基金Qwen3-235B金融判断2 个信源在谈事件专题推荐理由:桥水和Mira Murati团队发现,GPT和Claude在金融判断上准确率才70%,不如微调的Qwen3-235B的84.7%,成本还低14倍。原文稍后读已读值得跟进有用关注 桥水基金
20:49@koltregaskes@koltregaskes作者研究后发现,在Together AI或Fireworks上对7-16B模型做LoRA微调,计算成本仅需£10-50,70B QLoRA也不超过£200。推理方面,托管端点按基模型费率收费约£0.20-0.90/百万token,自托管spot H100约£1-2.50/小时,但流量波动时容易超支。数据准备和GDPR合规仍需投入时间。整体门槛已大幅降低,适合企业用自有数据试点。技巧微调Together AIFireworks推荐理由:这位工程师给算了一笔账:微调7B模型只要几十英镑,而且托管推理按量付费,建议老板们别再犹豫了。原文稍后读已读值得跟进有用关注 微调
19:42官方账号Decoder@Maximilian Schreiner桥水基金与Thinking Machines Lab的测试显示,一个经过微调的开源权重模型在金融文档评估任务上超越了GPT-4和Claude 3.5,且成本降低90%。该微调模型基于Llama 3.1 70B,在桥水内部金融问答数据集上训练,准确率达到92%,而GPT-4仅为78%。测试涵盖2000份真实金融文件,正确答案未公开以避免数据污染。AI模型BridgewaterThinking Machines LabGPT2 个信源在谈事件专题推荐理由:桥水基金用自家金融数据微调了一个开源模型,结果比GPT和Claude都强,成本还低得多。想搞垂直领域微调的可以看看。原文稍后读已读值得跟进有用关注 Bridgewater
11:54官方账号arXiv cs.AI@Wentao Zhang, Liliana Hotsko, Woojeong Kim, Pengyu Nie, Stuart Shieber, Yuntian Deng精选PAW(Program-as-Weights)提出一种模糊函数编程范式,将自然语言规范编译为紧凑的本地可执行神经构件。一个4B编译器在FuzzyBench(1000万示例)上训练,为冻结的0.6B Qwen3解释器生成参数高效适配器。该解释器执行PAW程序,性能匹配直接提示Qwen3-32B,但推理内存仅为其1/50,在MacBook M3上达30 tokens/s。PAW将基础模型从逐输入求解器转变为可复用小工具构建器。AI模型PAWQwen3FuzzyBench推荐理由:PAW让模糊函数(如日志告警、修复JSON)不再依赖大模型API。用4B编译器一次编译,0.6B小模型就能跑出32B的效果,还省内存和算力。原文稍后读已读值得跟进有用关注 PAW
04:01The Rundown AI@therundownai精选Mira Murati的Thinking Machines Lab与全球最大对冲基金Bridgewater合作,测试AI用于投资新闻筛选。GPT、Claude、Gemini在六项过滤测试中平均准确率约50%。专家投资者编写提示词后准确率升至74-76%,但仍低于80%的信任阈值。通过TML的Tinker API微调开放权重模型,准确率达到84.7%,错误率比最佳前沿模型降低29.8%,且每任务成本仅为前者的1/13.8。AI模型Mira MuratiThinking Machines LabBridgewater2 个信源在谈事件专题推荐理由:Mira Murati团队和桥水基金一起搞了个AI筛选新闻的实验,先用GPT、Claude只有50%准确率,专家写提示词到75%还是不够,最后微调模型干到了84.7%,成本还低了13倍多。原文稍后读已读值得跟进有用关注 Mira Murati
01:38elvis@omarsar0推文强调调优LLM验证器和评判器正成为高需求技能。作者在自身测试框架上应用这些工具,实现了市场上尚未出现的agentic编码工作流。Bridgewater利用金融领域知识并与@tinkerapi合作微调模型,帮助分析师聚焦重点。这表明专家改进AI能提升专家效率。技巧LLM verifiersLLM judgesAgent工作流推荐理由:想搞高级Agent工作流?试试自己调验证器和评判器,比现成方案更强。原文稍后读已读值得跟进有用关注 LLM verifiers
12:13官方账号arXiv cs.LG@Xun Dong, Yibo Xu, Naigang Wang, Xin Li, Penghang Yin, Zi YangZO-Act提出一种激活感知的零阶微调方法,通过一次性计算输入激活基,将扰动限制在固定低秩子空间中,从而将有效扰动维度降低至系数矩阵大小。该方法在Llama-3-8B、OPT-13B和INT4 Llama-3-8B上实验,在语言理解、问答和常识推理任务中一致超越现有零阶微调基线。分析表明,ZO-Act通过低维系数扰动减少了方差依赖项和有限差分误差,并利用LLM激活和梯度的低秩结构控制子空间近似偏差。AI模型ZO-ActLlama-3OPT-13B推荐理由:ZO-Act用激活信息锁定关键子空间,让零阶微调更稳定,在Llama-3和OPT-13B上都比旧方法强,适合显存受限的场景。原文稍后读已读值得跟进有用关注 ZO-Act
05:51elvis@omarsar0当前微调仍是未被充分研究的领域。Agentic Fine-Tuning 被认为即将引发行业变革。PorTAL 工具允许用户快速更换基础模型,避免因模型迭代而重做微调。例如 Kimi 2.6 仅发布数月就已显过时,PorTAL 可解决这类问题。AI产品PorTALAgentic Fine-Tuning微调推荐理由:微调圈有新工具了!PorTAL 让你能轻松换基础模型,再也不用担心训练好的模型跟不上新版本。原文稍后读已读值得跟进有用关注 PorTAL
10:33官方账号arXiv cs.AI@Ekaterina Alimaskina, Denis Shveykin, Gleb Molodtsov, Igor Shalygin, Alexey Kadeishvili, Aleksandr Beznosikov语言模型越来越多地使用自生成的问答数据来微调或蒸馏。研究表明,生成阶段并非中性预处理,而是隐含策略:模型在提问时不会均匀扫描文档,覆盖很快饱和并集中在显著区域,不同提示也会聚焦相同片段。在回答阶段,模型倾向于服从文本中嵌入的指令性内容,且这种服从取决于指令的表面形式和意图。作者通过将每个问题固定到特定目标降低了选择偏差,并在回答前过滤指令性文本,将注入合规率从88%降至13%,同时保留几乎所有干净文本。论文自生成问答微调知识蒸馏推荐理由:这篇论文告诉你,用模型自己问自己生成的问答数据来训练模型,可能会引入隐蔽的偏见和指令注入风险。他们用一个简单方法就能把问题率从88%压到13%,值得做数据合成的同学看看。原文稍后读已读值得跟进有用关注 自生成问答
01:23官方账号NVIDIA AI@NVIDIAAI精选NVIDIA TAO 7 允许用户用自然语言向编码代理描述需求,自动执行模型调优。其 Agent 技能可接入编码代理并提升准确率,AutoML 自动搜索超参数,LLM 引导调优比传统方法快 2 倍。支持在本地 NVIDIA GPU 上微调任何 Hugging Face 的 CV 或 VLM 模型,数据增强微调能帮助代理识别失败原因并修复。AI产品NVIDIA TAOAutoML微调7 个信源在谈事件专题推荐理由:NVIDIA 发布了 TAO 7,你只需用大白话告诉编码代理要啥,它就能自己调模型,比手动调参快两倍,还能本地跑 Hugging Face 模型。原文稍后读已读值得跟进有用关注 NVIDIA TAO
00:50官方一手AWS Machine Learning Blog@Le VyAWS 博客介绍如何通过 Amazon SageMaker AI 微调 Amazon Nova 模型,以提升电子邮件数据提取的准确性。微调使模型识别特定数据模式并区分相似字段,提取准确率可达 94.77%。该方案同时将成本降低 50%,适用于需要高精度提取的业务场景。文章提供了详细步骤和示例代码。技巧Amazon NovaAmazon SageMaker AI微调推荐理由:想用 Amazon Nova 搞邮件数据提取?这篇教程手把手教微调,准确率飙到 94.77%,成本还省一半。原文稍后读已读值得跟进有用关注 Amazon Nova