8月23日
16:18
8月22日
03:53
8月21日
17:08
06:58
06:58IT之家博客/媒体
精选
蚂蚁百灵开源了 Ling-3.0-tiny-base 和 Ling-3.0-flash-base 模型。官方开放了预训练、中期训练和 WSM 合并等 6 个关键训练节点权重。Ling-3.0-tiny-base 模型总参数 7.9B,在代码能力上表现优异。Ling-3.0-flash-base 模型总参数 124B,适合研究者和开发团队继续训练。这些 Base 模型并非聊天模型,不建议直接部署为面向终端用户的服务。

推荐理由:蚂蚁百灵把 Ling-3.0-tiny 和 flash 的 Base 模型开源了,还把训练过程中的 6 个关键节点权重都放出来了。tiny 模型参数少但代码能力强,flash 模型参数多适合继续训练,对研究者挺有用。
02:05
02:05Philipp Schmid@_philschmid
精选
Awesome Gemma 资源库已在 GitHub 上线。该库收录了 16 个 Gemma 模型变体的模型卡片和合集。它还提供了 Ollama、vLLM 和 LiteRT 的设置指南。此外,库中包含 Unsloth、Tunix 和 MLX 的微调教程。社区项目、应用和演示也包含在内。

推荐理由:Google 的 Awesome Gemma 资源库上线了,里面有你想要的模型卡片、部署指南和微调教程,比自己找方便多了。
8月20日
23:04
8月19日
03:38
8月17日
8月15日
19:32
8月14日
8月13日
17:54
17:54官方账号Cohere@cohere
精选
Cohere 宣布其视觉模型 North Micro Vision 已集成至开源微调框架 Axolotl。用户无需自备 GPU 或服务器,即可直接开始训练该模型。Axolotl 官方文档已提供 Cohere 模型的配置说明,地址为 docs.axolotl.ai。这降低了视觉模型微调的门槛。
推荐理由:想微调 Cohere 的视觉模型 North Micro Vision?现在用 Axolotl 就能跑,不用自己买显卡,直接上手试试吧。
17:48
17:48官方账号NVIDIA AI@NVIDIAAI
CodeRabbit与Baseten合作,用CodeRabbit自身的路由决策数据微调了NVIDIA Nemotron 3.5 Lightning。整个微调过程耗时不到3小时,花费低于100美元。微调后的模型相比此前的GPT级模型,准确率提升约4%,推理成本下降约50%。详细技术解析已发布在CodeRabbit官方博客。
事件专题

推荐理由:CodeRabbit用不到100美元和三小时微调了NVIDIA新模型,比原来的GPT级模型准确率高4%,推理成本还省一半,想省钱的可以看看。
07:20
07:20官方账号NVIDIA AI@NVIDIAAI
精选
NVIDIA 发布全新 MoE 模型 Nemotron 3.5 Lightning。distil labs 作为欧洲发布合作伙伴,对其进行了微调。该团队将微调版与 4 个可比 MoE 模型在 6 项任务上对比,未微调时排名第三,微调后跃居第一。完整数值与失败场景已公布在 distil labs 博客上。
事件专题

推荐理由:NVIDIA 的 Nemotron 3.5 Lightning 微调后,在 6 项任务上超过 4 个同类 MoE 模型拿了第一。想知道怎么调出来的,可以看这篇。
03:57
03:57官方一手marktechpost@Sana Hassan
精选
AllenAI 的 Open Instruct 框架支持在 16GB 显存上完成 LLM 后训练全流程。教程覆盖 SFT、DPO、RLVR 和 GRPO 四种主流方法。验证器(verifier)被用于评估模型输出质量。无需分布式计算基础设施,单卡即可运行。
推荐理由:想自己微调模型又没大显卡?这份教程教你在 16GB 显存上跑完 SFT、DPO、GRPO 全流程,用的还是 AllenAI 的开源框架。
8月11日
8月5日
11:38
11:38官方账号arXiv cs.AI@Dongjie Yang, Siyan Lin, Leixian Shen, Rui Sheng, Huamin Qu, Zixin Chen
论文提出TACT框架,用于训练和评估教学自适应的英语辅导模型。该框架包含13种辅导策略的Tutor-Strategy分类法和描述学生行为的Student-Move分类法。基于两套分类法构建的TACTCorpus覆盖260段师生对话,含32,379条标注。后训练的TACTutor在TACTBench(78个场景)上比基座模型Qwen3.5-4B提升20.30%,并在50名学习者的盲测中获得最高评分。
推荐理由:这篇论文把教学策略拆成13种,用260段真实对话和3.2万条标注训练出TACTutor,在78个测试场景比基座涨了20%,盲测还赢过商业模型。
8月1日
01:56
01:56Fireworks AI@FireworksAI_HQ
精选
Fireworks AI 在博客中建议,LoRA 表现不佳时先别急着换成更贵的全参数微调。他们用数据覆盖、优化、秩三项低成本测试,看能否缩小 LoRA 与 FullFT 的差距。在 Fireworks 的测试中,有时能缩小差距,有时不能。

推荐理由:Fireworks 试了三个便宜测试,看 LoRA 能否追平全参数微调,有时行有时不行。看完就知道先调啥。
7月31日
7月30日
7月29日
11:35
11:35Fireworks AI@FireworksAI_HQ
精选
Fireworks为DeepSeek V4 Flash新增微调能力,支持监督微调、偏好调优和组合偏好优化。用户可通过训练API进行强化学习,面向编码代理和高吞吐量生产场景。企业现可联系Fireworks(fireworks.ai/contact-traini…)使用该功能。
事件专题

推荐理由:Fireworks给DeepSeek V4 Flash加了全套微调,监督、偏好、RL都能用,专为编码场景设计,快去试试。
08:20
08:20Fireworks AI@FireworksAI_HQ
Fireworks宣布支持对Kimi K3进行微调。Kimi K3是首个3万亿参数的开源前沿模型。通过Training API,用户可进行监督微调、偏好微调和强化学习。训练支持专用和无服务器两种模式,适合产品化部署。
事件专题

推荐理由:Fireworks现在可以微调Kimi K3了,3万亿参数的开源模型,支持多种训练方式,适合定制产品。
03:10
03:10Fireworks AI@FireworksAI_HQ
Fireworks AI 宣布在其平台上支持微调 Kimi K3 模型。用户可使用自有数据训练模型,并托管在美国端点。微调后的模型权重归用户所有,且平台承诺零数据留存。无需担心数据泄露风险,直接通过 Fireworks 平台开始构建。
事件专题

推荐理由:想用自己的数据微调模型还不想把数据交给别人?Fireworks 上的 Kimi K3 能做到,权重归你,数据不留。