13:20向阳乔木@vista8精选Nathan Lambert 撰写了一本专门介绍大模型 RLHF 的书籍,并配套 13 讲正课和免费 PPT。课程不要求大语言模型基础,适合初学者借助 AI 辅助学习。内容从 LLM 原理、KL 散度、交叉熵等基础讲起,涵盖 RLHF 和后训练框架、指令微调、奖励模型、拒绝采样、RLVR、DPO 等。还涉及合成数据和当前 Post Training 方法,课程和 PPT 可在评论区获取。技巧RLHFNathan Lambert后训练推荐理由:Nathan Lambert 出书讲 RLHF,还配了 13 讲免费课和 PPT,零基础也能跟着学,想入门后训练可以看看。原文稍后读已读值得跟进有用关注 RLHF