精选理由
Nathan Lambert 出书讲 RLHF,还配了 13 讲免费课和 PPT,零基础也能跟着学,想入门后训练可以看看。
Nathan Lambert 撰写了一本专门介绍大模型 RLHF 的书籍,并配套 13 讲正课和免费 PPT。课程不要求大语言模型基础,适合初学者借助 AI 辅助学习。内容从 LLM 原理、KL 散度、交叉熵等基础讲起,涵盖 RLHF 和后训练框架、指令微调、奖励模型、拒绝采样、RLVR、DPO 等。还涉及合成数据和当前 Post Training 方法,课程和 PPT 可在评论区获取。
原文 · 向阳乔木
Nathan Lambert 写一本专门介绍大模型 RLHF 的书。 配套 13 讲正课和免费 PPT,大善人啊。 不要求大语言模型基础,只有学习动力,加上AI辅助完全可以学。 开头讲基础:LL...
Nathan Lambert 写一本专门介绍大模型 RLHF 的书。 配套 13 讲正课和免费 PPT,大善人啊。 不要求大语言模型基础,只有学习动力,加上AI辅助完全可以学。 开头讲基础:LLM原理、KL 散度、交叉熵等。 后正文讲了 RLHF 和后训练的基础框架、指令微调、奖励模型、拒绝采样、RLVR 、DPO等。 还有合成数据和现在的Post Traing训练方法。 课程和PPT下载见评论区,比较硬核。 💬 2 🔄 0 ❤️ 11 👀 1504 📊 5 ⚡