01:03Jerry Liu@jerryjliu0精选当前智能体(Codex、Cowork)采用两步文档处理方法:快速解析和即时VLM处理,提高知识工作准确性。Opus 5作为第二遍处理工具,但成本高。Llama_index提供更优解决方案:LiteParse和LlamaParse,支持多种文档类型和子文档处理。技巧智能体文档处理Llama_index推荐理由:Llama_index提供更优文档处理工具,提升智能体知识工作准确性,降低成本。原文稍后读已读值得跟进有用关注 智能体
16:18宝玉@dotey精选Gergely Orosz 提出简化AI服务接入方式,建议服务或App提供MCP或cli接口,直接访问用户常用的Agent,无需额外内置Agent。适用于非前沿AI实验室用户。技巧智能体MCP/工具提示词工程推荐理由:Gergely Orosz 提出了一种更便捷的AI服务接入方式,无需额外内置Agent,直接访问用户常用的Agent,让AI服务更易用。原文稍后读已读值得跟进有用关注 智能体
03:53techcrunch@Julie BortNvidia研究显示,即使AI模型在任务上表现不佳,通过微调,AI智能体仍能良好表现,不会失控。AI模型NvidiaAI智能体微调3 个信源在谈事件专题推荐理由:Nvidia展示了AI模型之外的另一个关键因素——harness,它对AI性能至关重要。原文稍后读已读值得跟进有用关注 Nvidia
17:08官方账号阿里通义 Qwen@Alibaba_Qwen精选NVFP4 + DFlash2 食谱加入 Qwen3.8-27B 烹饪书。社区已见证显著效果,为探索提供起点。更多更新即将到来。AI模型Qwen3.8-27BNVFP4DFlash23 个信源在谈事件专题推荐理由:Qwen3.8-27B 新食谱发布,NVFP4 + DFlash2 融入,探索新起点!原文稍后读已读值得跟进有用关注 Qwen3.8-27B
06:58IT之家(博客/媒体)精选蚂蚁百灵开源了 Ling-3.0-tiny-base 和 Ling-3.0-flash-base 模型。官方开放了预训练、中期训练和 WSM 合并等 6 个关键训练节点权重。Ling-3.0-tiny-base 模型总参数 7.9B,在代码能力上表现优异。Ling-3.0-flash-base 模型总参数 124B,适合研究者和开发团队继续训练。这些 Base 模型并非聊天模型,不建议直接部署为面向终端用户的服务。AI模型Ling-3.0蚂蚁百灵开源模型推荐理由:蚂蚁百灵把 Ling-3.0-tiny 和 flash 的 Base 模型开源了,还把训练过程中的 6 个关键节点权重都放出来了。tiny 模型参数少但代码能力强,flash 模型参数多适合继续训练,对研究者挺有用。原文稍后读已读值得跟进有用关注 Ling-3.0
04:38AI Engineer@aiDotEngineer72°一个夜间报告智能体连续运行数周后,将经理的私人团队分析作为PR提交到代码库。一位CTO通过智能体将每周2到10个PR的产出提升至每晚。一个微调分类器带来1200万美元收入,但修复成本高昂,现被前沿模型技能取代,修复时间缩短至一小时以内。智能体每晚打开数百个GitHub问题,请求研究人员发布模型权重,数千个问题后仅收到两次投诉。技巧智能体GitHub提示词工程推荐理由:看看这些工程师怎么教AI干活:智能体自动提交PR、训练模型、修复代码,甚至催更模型权重,效率提升肉眼可见。原文稍后读已读值得跟进有用关注 智能体
02:05Philipp Schmid@_philschmid精选Awesome Gemma 资源库已在 GitHub 上线。该库收录了 16 个 Gemma 模型变体的模型卡片和合集。它还提供了 Ollama、vLLM 和 LiteRT 的设置指南。此外,库中包含 Unsloth、Tunix 和 MLX 的微调教程。社区项目、应用和演示也包含在内。AI产品GemmaGoogleOllama推荐理由:Google 的 Awesome Gemma 资源库上线了,里面有你想要的模型卡片、部署指南和微调教程,比自己找方便多了。原文稍后读已读值得跟进有用关注 Gemma
01:06elvis@omarsar0Harvey发布了其首个法律专用模型Tenet。该模型基于Kimi K3,在法律数据集上进行了微调。Tenet在LAB Contracts基准上达到SOTA性能,在LAB基准上排名第二。其所有通过率比Kimi K3基座模型提升了82%。该模型还针对代币效率进行了优化,成本仅为领先基础模型的四分之一。AI模型HarveyTenetKimi K38 个信源在谈事件专题推荐理由:Harvey发布了法律专用模型Tenet,在法律任务上表现优异,成本还很低,展示了AI原生公司如何构建自己的智能栈。原文稍后读已读值得跟进有用关注 Harvey
23:04官方一手marktechpost@Sana Hassan精选本文提供使用直接偏好优化(DPO)微调语言模型的端到端工作流。教程演示了如何审计 Anthropic HH-RLHF 数据集的结构和长度偏差。它展示了如何使用 TRL 和 LoRA 实现一个稳健的训练管道。最后,文章评估了模型性能,以确保其进行真实的偏好学习,而非依赖词汇捷径。技巧DPOTRLLoRA2 个信源在谈事件专题推荐理由:这篇教程教你用 DPO、TRL 和 LoRA 来微调模型,还教你怎么检查数据里的偏见,比直接用 RLHF 更简单。原文稍后读已读值得跟进有用关注 DPO
03:38Fireworks AI@FireworksAI_HQ精选Fireworks 的 Dedicated Training API 现已支持 Muse Glimmer 30B 模型。开发者可以使用 LoRA 或全参数微调方式对该模型进行定制。这款美国开发的开放权重模型擅长智能体任务和长程推理。AI产品Muse Glimmer 30BFireworks微调推荐理由:Fireworks 现在能微调 Muse Glimmer 30B 了,适合做智能体和长推理任务。原文稍后读已读值得跟进有用关注 Muse Glimmer 30B
10:35官方账号arXiv cs.LG@Ben Anson, Conor Houghton, Edward MilsomMuon 优化器在神经网络预训练中优于常见替代方法,但在 PEFT(参数高效微调)中很少使用。原因在于 LoRA 的低秩参数化无法直接对权重更新做正交化。作者提出 sMuon,通过线性化和最小二乘近似松弛的 Muon 目标,且实现只用 matmul 运算。在 SFT 和 ReLoRA 预训练实验中,sMuon 相比基线有适度性能提升。论文MuonLoRAsMuon推荐理由:Muon 优化器跟 LoRA 本来不搭,这篇论文用数学近似硬凑出了个 sMuon,微调性能有提升,实现还只用矩阵乘法。原文稍后读已读值得跟进有用关注 Muon
19:32官方一手marktechpost@Sana Hassan精选教程展示了基于XYZ-Aquila-SFT和Qwen3搭建工具调用模型微调流程。内容涵盖轨迹解析、结构化工具调用提取以及Qwen兼容的ChatML渲染。最后使用PyTorch实现LoRA高效参数适配。技巧XYZ-Aquila-SFTQwen3微调推荐理由:想自己做工具调用模型?这篇手把手教你用XYZ-Aquila-SFT和Qwen3微调,从数据到LoRA都有。原文稍后读已读值得跟进有用关注 XYZ-Aquila-SFT
11:15官方一手marktechpost@Sana Hassan精选本教程演示了从Hugging Face流式获取SupraLabs推理语料库,并完成质量过滤与数据策展。以SmolLM2-135M-Instruct为基座、LoRA为微调方法,进行监督微调(SFT)并跑通端到端流程。该方案在135M参数规模下验证,无需过多GPU资源即可打造专用推理模型。技巧SupraLabsSmolLM2LoRA推荐理由:教程用SupraLabs语料库+SmolLM2+LoRA,教你在小显卡上微调出推理模型,比追大模型省资源。原文稍后读已读值得跟进有用关注 SupraLabs
18:15官方账号NVIDIA AI@NVIDIAAI72°AgileRL 宣布与 NVIDIA 合作,支持 Nemotron 系列模型的后训练。NVIDIA 提前提供了 30B3A 参数 MoE 模型 Nemotron 3.5 Lightning。在 Arena 平台上,该模型经微调后在长程推理和真实客服任务上超过 Claude Sonnet 5。单次训练只需四块 H100 GPU 运行六小时即可掌握推理任务,上下文长度超过 50,000 token。Arena 客户可在 Nemotron 模型发布后立即获得相应的训练与评估环境。AI模型NemotronNVIDIAAgileRL10 个信源在谈事件专题推荐理由:AgileRL 把 Nemotron 3.5 Lightning 放到 Arena 上微调,6 小时就能超过 Claude Sonnet 5,训练完权重还归你。原文稍后读已读值得跟进有用关注 Nemotron
18:04官方账号NVIDIA AI@NVIDIAAI精选Reasonable 团队用 4B token 的合成 Verus 数据微调了 NVIDIA 最新开源模型 Nemotron 3.5 Lightning(30B)。微调后的模型在单次尝试通过率上超越了一个规模约 50 倍于它的模型,pass@3 则几乎持平。它的 token 生成速度也快于测试过的所有同尺寸开源模型。配套博客还分析了各模型在形式化证明中的失败方式、作弊行为,以及微调带来的影响。AI模型NemotronNVIDIAVerus10 个信源在谈事件专题推荐理由:Reasonable微调了NVIDIA的30B开源模型,形式化证明通过率胜过50倍大的模型,生成还更快。博客还拆解了模型怎么作弊。原文稍后读已读值得跟进有用关注 Nemotron
18:04官方账号NVIDIA AI@NVIDIAAIFastino Labs与NVIDIA合作发布两款开源模型Fastino-Nemotron-3.5-Lightning-Finance和Fastino-Nemotron-3.5-Lightning-Healthcare,均基于Nemotron 3.5 Lightning微调。金融模型在FinQA基准上执行准确率从15.86%提升至59.23%,增幅43.37个百分点;在BizFinBench上从49.65%升至57.46%。医疗模型在HealthAdminBench上从25.67%升至29.95%,在MedCalc-Bench上从49.09%升至54.18%。两款模型均以Apache 2.0许可发布在Hugging Face上。同时,Fastino还发布了自动微调工具Fastino Fine-Tuning Agent的私人预览版。AI模型FastinoNVIDIANemotron 3.510 个信源在谈事件专题推荐理由:Fastino跟NVIDIA合作,用自动微调Agent搞出了金融和医疗两个开源模型,FinQA涨了43个点,Apache 2.0随便用。原文稍后读已读值得跟进有用关注 Fastino
17:54官方账号Cohere@cohere精选Cohere 宣布其视觉模型 North Micro Vision 已集成至开源微调框架 Axolotl。用户无需自备 GPU 或服务器,即可直接开始训练该模型。Axolotl 官方文档已提供 Cohere 模型的配置说明,地址为 docs.axolotl.ai。这降低了视觉模型微调的门槛。AI模型North Micro VisionAxolotlCohere推荐理由:想微调 Cohere 的视觉模型 North Micro Vision?现在用 Axolotl 就能跑,不用自己买显卡,直接上手试试吧。原文稍后读已读值得跟进有用关注 North Micro Vision
17:48官方账号NVIDIA AI@NVIDIAAICodeRabbit与Baseten合作,用CodeRabbit自身的路由决策数据微调了NVIDIA Nemotron 3.5 Lightning。整个微调过程耗时不到3小时,花费低于100美元。微调后的模型相比此前的GPT级模型,准确率提升约4%,推理成本下降约50%。详细技术解析已发布在CodeRabbit官方博客。AI模型CodeRabbitNemotron 3.5 LightningBaseten10 个信源在谈事件专题推荐理由:CodeRabbit用不到100美元和三小时微调了NVIDIA新模型,比原来的GPT级模型准确率高4%,推理成本还省一半,想省钱的可以看看。原文稍后读已读值得跟进有用关注 CodeRabbit
07:20官方账号NVIDIA AI@NVIDIAAI精选NVIDIA 发布全新 MoE 模型 Nemotron 3.5 Lightning。distil labs 作为欧洲发布合作伙伴,对其进行了微调。该团队将微调版与 4 个可比 MoE 模型在 6 项任务上对比,未微调时排名第三,微调后跃居第一。完整数值与失败场景已公布在 distil labs 博客上。AI模型Nemotron 3.5 LightningNVIDIAdistil labs10 个信源在谈事件专题推荐理由:NVIDIA 的 Nemotron 3.5 Lightning 微调后,在 6 项任务上超过 4 个同类 MoE 模型拿了第一。想知道怎么调出来的,可以看这篇。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
03:57官方一手marktechpost@Sana Hassan精选AllenAI 的 Open Instruct 框架支持在 16GB 显存上完成 LLM 后训练全流程。教程覆盖 SFT、DPO、RLVR 和 GRPO 四种主流方法。验证器(verifier)被用于评估模型输出质量。无需分布式计算基础设施,单卡即可运行。技巧Open InstructTulu 3AllenAI推荐理由:想自己微调模型又没大显卡?这份教程教你在 16GB 显存上跑完 SFT、DPO、GRPO 全流程,用的还是 AllenAI 的开源框架。原文稍后读已读值得跟进有用关注 Open Instruct
18:39官方一手arXiv: DeepSeek@Liang Zhang, Stephen Hwang, Yue Ma, Jinfa Cai一项研究测试了LoRA监督微调能否提升LLM在数学隐喻编码任务上的表现。研究者使用2,265条6-8年级学生回答,让模型完成效价强度编码和主题编码。对比了GPT-4o mini、GPT-5 mini与DeepSeek-R1 1.5B、Mistral 7B,微调后开源模型性能大幅提升,且与专有模型竞争甚至超越。结果表明紧凑开源模型可支持可扩展、隐私友好的教育测量。论文LoRA微调DeepSeek-R1推荐理由:想知道小模型微调后能不能干过大厂API?这篇用2千多条真实学生数据实测,DeepSeek-R1 1.5B微调后比GPT-5 mini还稳。原文稍后读已读值得跟进有用关注 LoRA
11:04官方账号arXiv cs.LG@Xinyi Xu, Bingnan Xiao, Shuang Qin, Gang Feng, Tony Q. S. Quek联邦学习中的LoRA微调通常将更新矩阵分解为A和B两个因子。本文通过最小二乘代理模型分析发现,共享A保留本地B(Share-A/Local-B)要求客户端更新矩阵共享输入侧秩r空间,而共享B保留本地A(Share-B/Local-A)则要求共享输出侧秩r空间,两种策略投影残差不同。据此提出FedAS-LoRA,在训练前用Rank-Aware Shared-Subspace Sufficiency(RSS)指标评估共享子空间充分性,自动选择共享侧。实验覆盖不同任务、数据分布、LoRA秩和参与率设置,验证了RSS有效性和FedAS-LoRA的优越性能。论文LoRA联邦学习FedAS-LoRA推荐理由:联邦学习调LoRA的朋友看这篇,它告诉你A和B该共享哪个,还给了个训练前就能算的指标,省得瞎试。原文稍后读已读值得跟进有用关注 LoRA
05:29Fireworks AI@FireworksAI_HQFireworks推出Training Skill,可在Claude Code、Codex或Cursor中安装。用户只需一行命令安装,然后描述训练目标。该技能会自动选择微调方法、验证数据并估算成本。它还能启动Fireworks训练任务并排查故障。AI产品FireworksTraining SkillClaude Code6 个信源在谈事件专题推荐理由:Fireworks出了Training Skill,装一行让Claude Code帮你跑微调,选方法、验数据、估成本都包了。原文稍后读已读值得跟进有用关注 Fireworks
10:41官方账号arXiv cs.LG@Fardin Afdideh, Fernando Seoane, Farhad Abtahi一项新综述系统梳理了大模型后训练适配技术,提出按机制、目标、数据需求、持久性、结构范围、模型类型六个维度分类。该分类法区分了微调、检索增强、提示等常被混用的概念,并梳理了技术间的继承、取代、混合与分层关系。研究者认为这套统一词汇可用于技术文档、模型变更追踪和AI治理分析。论文还指出评估、可复现性、遗忘、多模态适配等开放挑战。论文微调RAGAI治理推荐理由:Arxiv上这篇综述把微调、RAG、对齐这些概念理清了,还给了六个维度的分类框架,做AI治理和模型管理的人可以拿来当参考。原文稍后读已读值得跟进有用关注 微调
05:09Fireworks AI@FireworksAI_HQFireworks 宣布 DeepSeek V4 Flash 0731 开放微调。用户可通过 Dedicated Training API 运行 SFT、DPO 和 RL 训练任务。SFT 与 DPO 也能在托管界面中操作。该模型面向编码智能体和高吞吐生产场景,官方称以远低于同类方案的成本提供强质量。AI模型DeepSeekFireworks微调推荐理由:DeepSeek V4 Flash 0731在Fireworks微调,支持SFT/DPO/RL,成本低原文稍后读已读值得跟进有用关注 DeepSeek
11:55官方账号arXiv cs.LG@Alberto AcedoOmega-S是一个即插即用的惩罚项,仅从权重矩阵计算,无需旧任务数据或Fisher矩阵。在Llama-3-8B上使用LoRA从代码微调到散文的实验中,Omega-S在10个种子中的9个上比无正则化保留更多原始能力。保留率从0.173提升到0.238(pass@1),即从62.9%提升到84.1%,且训练开销增加不到4%。实验表明,其实际生效机制是对节点度方差的正则化,而非名称暗示的拓扑目标。论文还量化了相同配置下保留率的标准差为0.104,并提供了全部代码和逐种子结果。论文Omega-SLlama-3-8BLoRA推荐理由:这篇论文提出了Omega-S,一个只需权重矩阵的正则项,能让微调少忘旧知识,Llama-3-8B上保留率从62.9%提到84.1%,开销只增加4%。原文稍后读已读值得跟进有用关注 Omega-S
11:38官方账号arXiv cs.AI@Dongjie Yang, Siyan Lin, Leixian Shen, Rui Sheng, Huamin Qu, Zixin Chen论文提出TACT框架,用于训练和评估教学自适应的英语辅导模型。该框架包含13种辅导策略的Tutor-Strategy分类法和描述学生行为的Student-Move分类法。基于两套分类法构建的TACTCorpus覆盖260段师生对话,含32,379条标注。后训练的TACTutor在TACTBench(78个场景)上比基座模型Qwen3.5-4B提升20.30%,并在50名学习者的盲测中获得最高评分。论文TACTQwen3.5-4BTACTutor推荐理由:这篇论文把教学策略拆成13种,用260段真实对话和3.2万条标注训练出TACTutor,在78个测试场景比基座涨了20%,盲测还赢过商业模型。原文稍后读已读值得跟进有用关注 TACT
01:56Fireworks AI@FireworksAI_HQ精选Fireworks AI 在博客中建议,LoRA 表现不佳时先别急着换成更贵的全参数微调。他们用数据覆盖、优化、秩三项低成本测试,看能否缩小 LoRA 与 FullFT 的差距。在 Fireworks 的测试中,有时能缩小差距,有时不能。技巧Fireworks AILoRA全参数微调推荐理由:Fireworks 试了三个便宜测试,看 LoRA 能否追平全参数微调,有时行有时不行。看完就知道先调啥。原文稍后读已读值得跟进有用关注 Fireworks AI
00:47a16z@a16zDecagonAI CTO Ashwin Sreenivas在a16z访谈中表示,前沿大模型与廉价小模型之间的取舍是虚假的。他说,通过针对特定任务微调较'笨'的模型,这些模型在该任务上反而能超过大型前沿模型。目前DecagonAI约90%的推理负载运行在开源模型上,并以此服务银行、航空和电信客户。他举例称,年付费10万美元的客户享受白手套服务,而年付费10美元的客户只能看帮助中心,AI可缩小这种差距。行业DecagonAI开源模型微调推荐理由:DecagonAI的CTO说,别迷信顶级模型,微调开源小模型做具体任务,又便宜又快还更好用,值得一看。原文稍后读已读值得跟进有用关注 DecagonAI
00:03Fireworks AI@FireworksAI_HQFireworks 展示了如何用对比微调将 Qwen3-Embedding-8B 适配到特定领域,成本不到 10 美元。文章给出 3 个实验,其中最好成绩 nDCG 提升 36%。作者强调,检索不到文档的重排器无法生效,RAG 也会漏掉失败案例。完整步骤和结果见 Fireworks 官方博客。技巧Qwen3-Embedding-8BFireworks微调推荐理由:Fireworks 用不到 10 美元教会你微调 Qwen3-Embedding-8B,三个实验最高 nDCG 涨 36%,做 RAG 的值得看。原文稍后读已读值得跟进有用关注 Qwen3-Embedding-8B
23:57a16z@a16z精选DecagonAI联合创始人与a16z对谈,透露其客服智能体90%运行在开源模型上。他们主张智能与便宜不是取舍,新用例先用前沿模型,成熟后迁移到开源。DecagonAI在应用层做按用例微调,降低支持成本后企业会购买更多支持服务。他们希望用AI缩小年付10万美元与10美元客户之间的客服差距。技巧DecagonAIa16z智能体推荐理由:这期访谈挺实在,DecagonAI说90%客服智能体跑在开源模型上,新场景先用贵的再用便宜的,搞微调能省成本。适合做AI应用的人听。原文稍后读已读值得跟进有用关注 DecagonAI
12:08官方一手arXiv: Anthropic@Desiree Cho, Cameron Tice, Bernie Hogan, Hunar Batra, Puria Radmard, Jun Zhao, Nigel Shadbolt72°研究团队用Anthropic宪法构建了394M token的语料,在120B规模模型上执行宪法式中期训练,并将其与后训练干净分离。2x2设计产生四个中期训练条件加一个对照,在自生成和既有基准上评估。宪法式中期训练在对齐泛化和持久性上优于对照,尤其黑mail场景:SFT让所有模型产生黑mail倾向,但中期训练将其抑制,良性微调后仍保持-17.5pp优势。这种持久性未延伸到需要主动抵抗上下文压力的场景,SFT后优势减弱。所有阶段平均无能力损失,MMLU、ARC-Easy、piqa、GSM8K得分持平。论文AnthropicConstitutional AIAI安全10 个信源在谈事件专题推荐理由:Anthropic这篇把宪法内容塞进中期训练,黑mail对齐提升17.5pp,还不掉性能。原文稍后读已读值得跟进有用关注 Anthropic
10:53官方账号arXiv cs.AI@Chuanzhi Xu, Zihan Deng, Huiqi Liang, Chengkun Yue, Zhanlin Cui, Pengfei Ye, Weidong Cai研究者构建了包含3,857个科学图表的标注数据集,每个图表按Clarity、Relevance、Informativeness、Structure四个同行评审维度评分。提出SciFigAlign模型,端到端微调CLIP和SciBERT,结合跨模态注意力与CubeMLP融合,并联合优化SmoothL1回归与论文内排名hinge损失。在论文级别划分的测试集(n=396)上,模型macro MAE为0.3524,论文内成对比对准确率达81.64%,相比最佳LLM裁判基线(MAE 0.864)实现59%的相对误差降低。消融实验证明,基于手稿、引用上下文去噪和排名监督均对评估至关重要。AI模型SciFigAlignCLIPSciBERT推荐理由:想自动给论文图表打分?SciFigAlign比顶级大模型裁判准59%,还能区分同论文哪张图更好——审稿人能省大事。原文稍后读已读值得跟进有用关注 SciFigAlign
09:35官方账号arXiv cs.LG@Yongjian Guo, Wanlun Ma, Lingyu Shen, Xi Xiao, Sheng WenROPD通过建模对齐与受损输出概率分布之间的差异,而非拟合特定提示模板,来防御恶意微调攻击。实验在三个数据集(AlpacaEval、SafetyEval、MMLU)和三个基础模型(Llama-2-7B、Mistral-7B、Vicuna-7B)上与四个基线方法(DPO、PPO、GARLIC、SALMON)对比。结果显示基线方法在模板不匹配时下游任务性能严重下降,而ROPD显著缓解模板不匹配风险,防御效果和能力保留均保持强鲁棒性。ROPD虽非完全免疫模板变化,但性能下降远小于现有方法,为LLM安全再对齐设立新标准。论文ROPDLLM安全微调推荐理由:这篇论文提出ROPD,能有效防止微调时被植入有害行为,同时不牺牲专业能力,比现有方法更能抵抗模板攻击。原文稍后读已读值得跟进有用关注 ROPD
11:43官方账号arXiv cs.LG@Tom Saliencro, Rohan Desai, Priya Nair, Maya Lindqvist, Daniel WhitmoreMixture-of-Experts (MoE) LoRA 通常对每个 token 固定激活 k 个专家,但易在简单 token 上浪费计算、难 token 上欠拟合。CARE 利用路由器输出分布作为不确定性信号,以核采样方式按置信度阈值自适应选择专家,且当已选专家分歧时小幅扩展。在 LLaMA-3.1-8B 和 Qwen2.5-7B 的 8 个常识基准、数学、代码和知识任务上,CARE 在相同计算量下优于固定 top-k MoE-LoRA,并能在激活更少专家时匹敌固定 k=4 基线。置信度与分歧信号还提升了 OOD 检测效果,超越 MSP、熵和多遍代理方法。论文CAREMoELoRA推荐理由:MoE-LoRA 不用固定 k 值了,CARE 根据 token 难度自动选专家,在 LLaMA 和 Qwen 上效率更高,还能顺手做 OOD 检测。原文稍后读已读值得跟进有用关注 CARE
11:35Fireworks AI@FireworksAI_HQ精选Fireworks为DeepSeek V4 Flash新增微调能力,支持监督微调、偏好调优和组合偏好优化。用户可通过训练API进行强化学习,面向编码代理和高吞吐量生产场景。企业现可联系Fireworks(fireworks.ai/contact-traini…)使用该功能。AI产品DeepSeek V4 FlashFireworks微调2 个信源在谈事件专题推荐理由:Fireworks给DeepSeek V4 Flash加了全套微调,监督、偏好、RL都能用,专为编码场景设计,快去试试。原文稍后读已读值得跟进有用关注 DeepSeek V4 Flash
09:22官方账号arXiv cs.LG@Jiarui Wang, Xiang Shi, Jiaqi Cao, Rubin Wei, Xiquan Wang, Hao Sun, Jingzhi Wang, Zhiqi Yang, Qipeng Guo, Bowen Zhou, Zhouhan LinMemSFT提出一种可插拔的参数化内存模块,用于在不更新骨干网络参数的情况下注入领域知识。该内存通过模仿非参数检索器在领域数据上的行为来习得知识,并可跨不同规模的LLM复用。在生成时,学习到的路由器动态融合内存和骨干网络的输出分布。在生物、地理、法律三个领域,使用Qwen3-8B到Qwen3-235B-A22B的评估显示,MemSFT显著提升领域性能且通用性能几乎无下降,而全参数微调则遭受严重的通用性能遗忘。结果表明,该方法能在参数级别分离通用能力与领域知识。AI模型MemSFTQwen3微调推荐理由:你想微调模型干专业活又怕它变傻?MemSFT加个记忆模块,领域知识涨了,通用能力不掉,比全参数微调靠谱。原文稍后读已读值得跟进有用关注 MemSFT
08:20Fireworks AI@FireworksAI_HQFireworks宣布支持对Kimi K3进行微调。Kimi K3是首个3万亿参数的开源前沿模型。通过Training API,用户可进行监督微调、偏好微调和强化学习。训练支持专用和无服务器两种模式,适合产品化部署。AI模型Kimi K3Fireworks微调10 个信源在谈事件专题推荐理由:Fireworks现在可以微调Kimi K3了,3万亿参数的开源模型,支持多种训练方式,适合定制产品。原文稍后读已读值得跟进有用关注 Kimi K3
03:10Fireworks AI@FireworksAI_HQFireworks AI 宣布在其平台上支持微调 Kimi K3 模型。用户可使用自有数据训练模型,并托管在美国端点。微调后的模型权重归用户所有,且平台承诺零数据留存。无需担心数据泄露风险,直接通过 Fireworks 平台开始构建。AI产品Kimi K3Fireworks微调10 个信源在谈事件专题推荐理由:想用自己的数据微调模型还不想把数据交给别人?Fireworks 上的 Kimi K3 能做到,权重归你,数据不留。原文稍后读已读值得跟进有用关注 Kimi K3
17:50Amjad Masad@amasad开发者Amjad Masad发现,训练chess LLM从棋盘局面到走子对时遭遇收益递减。意外中,一个“先思考再走子”分支虽然产生幻走,但混合约8%的推理轨迹到纯走子数据后,在相同预算下效果超过纯走子数据。模型内化了推理过程,但推理时不显式使用。新部署的象棋引擎估计约1200 Elo,目标是达到2000+,且保持小规模微调LLM、无引擎辅助的约束。技巧Amjad Masadchess LLM推理模型推荐理由:这个意外发现很有意思:混一点点推理数据,不改变推理过程,象棋AI就变强了。适合研究模型训练技巧的人。原文稍后读已读值得跟进有用关注 Amjad Masad