8月21日
02:03
00:05
00:05elvis@omarsar0
精选
该论文分析了大量公开的智能体后训练轨迹。研究发现,智能体在第一步就锁定了训练策略,后续仅进行局部调整。论文尝试了三种改进方法:经验驱动的脚手架提升了GSM8K和HumanEval的分数,但策略仍保持冻结。人类指导能改变初始选择,但训练开始后智能体又回到局部循环。额外推理计算对简单任务有效,对最难任务几乎无效。
事件专题

推荐理由:这篇论文测试了智能体能否训练其他智能体,发现它们在第一步就锁定了策略,后续改进效果有限。作者尝试了三种方法,但智能体仍缺乏在执行中重新考虑策略的能力。
8月20日
10:12
10:12官方账号arXiv cs.LG@Joy Jia Yin Lim, Xin Huang, Hao Peng, Yaxi Lu, Xin Cong, Zhong Zhang, Maosong Sun, Yankai Lin
针对大型语言模型(LLM)后训练,研究发现其训练策略常锁定初始选择;分析公开数据后发现,训练预算多用于局部调整而非策略修订;干预实验显示,增加经验或指导仅提升执行效果,未改变策略;不同任务上的计算投入效果存在明显差异。
事件专题

推荐理由:OpenAI做了关于大模型后训练的研究,能分析训练策略问题,和以前方法比效果不一样。
8月15日
8月14日
23:19
23:19小互@imxiaohu
75°
智谱发布 GLM-5.3,基座模型与 GLM-5.2 完全相同,所有改进均来自后训练。内部评测显示编程能力比 GLM-5.2 提升 50%,网络安全能力持平 Mythos 5。该模型已在 269 个开源项目中挖出 2436 个真实漏洞。
事件专题

推荐理由:智谱用同一套基座只做后训练,就把 GLM-5.3 的编程能力拉高了五成,还能在开源项目里挖出两千多个漏洞,挺值的看。
17:26
17:26官方一手歸藏(guizang.ai)@op7418
72°
智谱发布GLM-5.3,基于743B基础模型仅做后训练,未重新预训练。新版本重点提升安全能力,针对模型防御场景做了优化。长程任务执行显著增强,包括终端操作、工具调用及大型代码库修复。在开源模型中,其网络安全能力达到新水平。
事件专题

推荐理由:智谱发了GLM-5.3,没重新预训练就靠后训练把安全和长程任务拔高一大截,搞智能体或代码修复的值得看看。
8月13日
18:06
18:06官方账号NVIDIA AI@NVIDIAAI
精选71°
Harvey联合Trajectory Labs对NVIDIA的Nemotron 3.5 Lightning进行后训练,在Legal Agent Bench上得分从0%升至8.3%。该成绩超过了Opus 4.6和更大的后训练版Nemotron 3 Ultra。后训练覆盖九个执业领域,未出现能力退化。平均输出长度从90k tokens降至37k tokens,每token奖励提升2.4倍。
事件专题

推荐理由:Harvey把Nemotron 3.5 Lightning后训练了一把,法律Agent评测从0冲到8.3%,比Opus 4.6还强,输出也从90k缩到37k,省Token。
03:57
03:57官方一手marktechpost@Sana Hassan
精选
AllenAI 的 Open Instruct 框架支持在 16GB 显存上完成 LLM 后训练全流程。教程覆盖 SFT、DPO、RLVR 和 GRPO 四种主流方法。验证器(verifier)被用于评估模型输出质量。无需分布式计算基础设施,单卡即可运行。
推荐理由:想自己微调模型又没大显卡?这份教程教你在 16GB 显存上跑完 SFT、DPO、GRPO 全流程,用的还是 AllenAI 的开源框架。
8月12日
18:04
18:04官方一手arXiv: DeepSeek@Hejia Zhang, Sheng Lu, Zhongming Yu, Chia-Tung Ho, Brucek Khailany, Jishen Zhao
CHORUS是一个面向硬件验证测试激励生成的后训练框架,利用分阶段监督微调产生行为多样的检查点,再通过密集奖励强化学习将其转化为任务级优势互补的专家模型。该框架通过无训练模型合并或进一步后训练整合专家优势,最终将多个专家合并为单个4B模型。CHORUS在CVDP-ECov基准上达到88.0%的Pass@1,比DeepSeek-R1(671B)高出13.5个百分点。
推荐理由:做硬件验证的可以看看,CHORUS用4B小模型在CVDP-ECov上干翻了671B的DeepSeek-R1,靠的是把多个专家模型合并起来,思路挺巧。
8月10日
22:46
22:46官方账号Nathan Lambert: Interconnects@Nathan Lambert
Interconnects 的作者在博客发布后训练教科书,完整记录其训练开源模型的长期经验。书名并未在新闻中给出,但宣传语强调书中包含5个实用要点,覆盖后训练关键技术。这本书是作者多年积累的成果,适合需要系统学习后训练的开发者阅读。

推荐理由:想学后训练的话,这本新书把作者训练开源模型的干货总结成5个要点,比看零散博客省事。
8月6日
11:16
11:16官方账号arXiv cs.LG@Zheyuan Zhang, Manqing Mao, Hong Wang, Zhuoer Wang, Samson Koelle, Jie Yuan, Yanjun Lin, James Feng, Nikki Lijing Kuang, Yanfang Ye, Wei Niu
RAIL是一种训练时框架,通过在线上下文bandit建模干预选择,学习如何为策略生成rollout。它利用影子到实时程序收集干预轨迹,训练恢复控制器,使控制器随策略演化持续学习。在多个设置下,RAIL在有限rollout预算下持续提升性能。结果表明恢复感知干预能生成更有信息量且更少冗余的rollout,增强后训练的学习信号。
推荐理由:这篇论文提出RAIL,把干预选择当成在线学习问题,让模型在有限预算下学到更有效的rollout,适合做RL后训练的人看。
8月5日
12:13
12:13AI Engineer@aiDotEngineer
精选
AI Engineer World's Fair 2026正在进行后训练与中间训练轨道直播,共9场演讲、11位演讲者。参与机构包括TypeSafe AI、Hugging Face、Prime Intellect、MiniMax等。活动核心论点是“模型不会做你想要的,它做你奖励的”,强调奖励机制在训练中的作用。

推荐理由:AI工程师大会正在播后训练专场,9场演讲聊透奖励怎么塑造模型,有Hugging Face和MiniMax的人,想学训练别错过。
7月23日
10:00
10:00官方一手arXiv: DeepSeek@Dongfang Li, Xiaodong Luo, Ruoyu Sun, Xuhui Chen, Linyuan Qiu, Jian Meng, Zhengxuan Lu, Yiting Wang, Yucheng Xie, Tao Guo, Tianxiang Fang, Jing Li, Sihang Chen, Shihao Hong, Chang Liu, Weihua Dai, Zirong Zeng, Ziwei Zhu, Zhuohan Wang, Zhengjun Yue, Igor Vasilyev, Min Liu, Weijian Sun, Xin Chen, Yingmeng Gao, Jinhua Zhou, Taolue Chen, Chenwei Wu, Dong Zhang, Wenlong Jin, Jinmin Xiang, Barkova Maria, Ushakov Anton, Xianfei Jin, Tian Ding, Zhihang Lin, Qian Chen, Linxin Yang, Mingzhe Yang, Bingwei Zhang, Hongzhang Yang, Fangxue Zhang, Shijun Qin, Jie Yu, Cuihua Hu, Tolstykh Vasiliy, Nosov Ivan, Abdullin Amir, Zhichen Zhou, Xin Zhang, Zhixiong Ning, Xutong Zhao, Junjie Huang, Jiajun Liu, Weiyan Kong, Zheng Zhang, Wenhan Luo, Lin Hu, Yangbo Guo, Li Zeng, Shihao Zeng, Baotian Hu, Min Zhang, Haizhou Li, Zhiquan Luo
精选
该论文针对万亿参数MoE模型DeepSeek-V4在Ascend NPU SuperPOD上的全参数后训练,提出分层优化框架,实现34.22%的模型算力利用率(MFU),较开源基线提升2.93倍。基于优化基础设施,论文构建了面向运筹学(OR)任务的连续预训练(CPT)和微调(SFT)工作流。SFT数据集包含10K高质量样本,涵盖4个任务类别和3种问题表示。专用模型DeepSeek-V4-Flash-OR在零样本Pass@1上达到71.81%,比GPT-5.4-Mini高3.98个百分点,比基础DeepSeek-V4-Flash高11.27个百分点。
推荐理由:这篇论文展示了如何在华为Ascend芯片上高效后训练万亿参数模型,并且通过运筹学专用微调,在特定任务上超越了GPT-5.4-Mini。
7月22日
10:27
10:27官方一手Pandaily@contact@pandaily.com (Pandaily)
精选
MindLab发布Macaron-V1,一种基于混合LoRA的后训练方法,应用于GLM 5.2。该方法包含4个专门的1B参数专家适配器,支持2M token上下文扩展。通过RL训练,748B参数的Venti变体仅用64块GPU即可完成训练,显著降低万亿参数模型的后训练成本。

推荐理由:MindLab用Macaron-V1在64块GPU上训出748B模型,比传统RL省资源,适合想低成本强化大模型的人
7月21日
7月20日
09:22
09:22官方账号arXiv cs.AI@Haoran Sun, Wentao Zhang, Junyang Hua, Hedan Yang, Yongjian Guo, Yifei Zhang, Xiaolong Xiang, Mingxi Luo, Jing Long, Chen Zhao, Chen Zhou, Wanting Xu, Qiming Yang, Hui Zhang, Song Wang, Xiaodong Bai, Shuai Di, Xu Chu, Xiaotie Deng, Yicheng Gong, Junwu Xiong
JoyNexus是一个统一服务,支持多租户VLA模型的监督微调、强化学习和评估。它通过解耦Training Model Service、Inference Model Service和Environment Service,租户通过API调用。采用group batching技术,使不同VLA数据模式共享一个前向传播,提升训练效率。实验表明,相比单租户独立执行,JoyNexus减少了总GPU时间并提高了服务利用率。
推荐理由:做VLA模型微调或机器人仿真的团队可以看看,JoyNexus用分组批处理省GPU资源,多租户场景下效率更高。
7月17日
00:40
00:40官方账号NVIDIA AI@NVIDIAAI
精选
NVIDIA官方展示了如何借助TAO Agent Skills在一天内对Cosmos 3模型进行后训练。该流程通过TAO平台的自定义能力,让用户快速将预训练模型适配到新场景。无需从头训练,显著降低时间与资源成本。
事件专题

推荐理由:想快速定制Cosmos 3?NVIDIA的TAO Agent Skills教你一天搞定后训练,适合开发者上手。
7月11日
15:19
15:19IT之家博客/媒体
73°
GPT-5.6 Sol 能充当“自动化研究员”,为较小模型 Luna 定制完整后训练方案。在内部评估套件“聚合 RSI”上,GPT-5.6 Sol 比 GPT-5.5 高出 16.2 个百分点。活跃研究员人均日 token 产出较 GPT-5.5 翻倍以上,单个研究员 pull request 和实验数量均上升。
事件专题

推荐理由:OpenAI 新出的 GPT-5.6 Sol 能自己训练小模型Luna,研究效率比上一代高16%,研究员一天干的活翻倍了。
7月10日
02:31
02:31Aravind Srinivas@AravSrinivas
精选
Arav Srinivas宣布将在美国的NVIDIA B200s上托管一个模型,并计划对Nemotron 3 Ultra进行后训练。后训练旨在提升该模型的性能,使其与美国开源模型具备同等能力。更多细节即将公布。
事件专题

推荐理由:Arav Srinivas说要在美国用B200s跑Nemotron 3 Ultra后训练,让美国开源模型追上对手进度。
02:04
7月9日
6月16日
14:21
14:21Fireworks AI@FireworksAI_HQ
Fireworks AI 与 LangChain 合作推出新方案,允许客户从应用 traces 中生成定制训练数据。该方案支持持续后训练(continuous post training),帮助企业利用自有数据建立数据护城河。研究由 LangChain Labs 与 Fireworks AI 联合开展,旨在降低 AI 定制门槛。
推荐理由:Fireworks AI 和 LangChain 搞了个新路子:从你的 traces 里自动生成训练数据,然后持续后训练,让你真正掌控自己的 AI 和数据。
6月12日
04:04
04:04官方账号Together AI@togethercompute
精选
Trajectory Labs 在 Together Compute 和 NVIDIA 的支持下,仅用不到 24 小时就在一个开放模型上实现了前沿模型级别的性能。这展示了当优秀开源模型与合适的训练基础设施结合时,可以快速取得显著成果。Together Compute 为此提供了算力支持,凸显了开放模型生态的潜力。
事件专题

推荐理由:对于关注开源模型训练效率的团队,这个案例证明了 24 小时内就能让开放模型达到前沿水平,值得研究其训练流程。
6月11日
11:58
11:58官方账号arXiv cs.LG@Leon Bergen, Usha Bhalla, Sidharth Baskaran, Max Loeffler, Raphael Sarfati, Dhruvil Gala, Ryan Panwar, Santiago Aranguri, Thomas Fel, Atticus Geiger, Matthew Kowal, Siddharth Boppana, Daniel Balsam, Owen Lewis, Jack Merullo, Thomas McGrath, Ekdeep Singh Lubana
精选
这篇论文提出了一种基于可解释性的后训练数据管道,用于诊断和修正偏好数据中的虚假关联。作者通过可解释性协议识别出数据中潜在的概念,让用户能明确哪些行为应该被模型学习。实验表明,该方法能有效缓解过度风格化、谄媚等不良行为,并增强安全性和个性等期望属性。这项工作将后训练从优化黑箱奖励转变为审计和塑造学习信号的过程。
推荐理由:做模型对齐和偏好优化的团队终于有了数据层面的诊断工具——不用再盲目调奖励权重,直接看数据教了模型什么。做安全对齐或模型人格定制的开发者建议点开,能省下大量试错时间。