#后训练
Epoch AI 做了个叫 InnovationEval 的基准,专门测 AI 智能体能不能自己搞出像样的后训练创新,目前结果挺拉胯的,想追自动化研究进展的可以看看。
Legora 的 CEO 说选法律 AI 别纠结哪个模型最强,他们直接做了套路由系统,按任务自动挑模型,窄任务还自己微调小模型。
arXiv 上这篇挺有意思:想知道 RL 训练后哪些题能解出来,用别的模型训过的 checkpoint 预测,比一堆先验指标都准。
Perplexity 分享了怎么让 Computer 模型从自己的错误里学习,A/B 测试里工具调用失败率降了 21.2%,做法挺值得看看的。
Perplexity 公开了他们训练 Computer 智能体的后训练细节,用 RFT 加自蒸馏纠正错误工具调用,实测失败率降了 21%,做 agent 的话值得看看他们怎么用真实用户会话。
想用最强开源编程模型的可以蹲一下,GLM-5.3 纯靠后训练就把 Terminal-Bench 分数翻了 6 倍,两周后开放权重。
Harvey把Nemotron 3.5 Lightning后训练了一把,法律Agent评测从0冲到8.3%,比Opus 4.6还强,输出也从90k缩到37k,省Token。
Trajectory 一键后训练 Nemotron 3.5 Lightning,测试冲到 8.3% 超 Opus 4.6,小模型按客户定制能落地。
想自己微调模型又没大显卡?这份教程教你在 16GB 显存上跑完 SFT、DPO、GRPO 全流程,用的还是 AllenAI 的开源框架。
做硬件验证的可以看看,CHORUS用4B小模型在CVDP-ECov上干翻了671B的DeepSeek-R1,靠的是把多个专家模型合并起来,思路挺巧。
Nathan Lambert 出书讲 RLHF,还配了 13 讲免费课和 PPT,零基础也能跟着学,想入门后训练可以看看。