#Nathan Lambert
共 3 条 · 7 天 1 条 · 30 天 2 条
信息流里打上「Nathan Lambert」标签的资讯、产品与论文,按刊登时间排,新的在上。
9月26日
9月15日
RLHF 首部系统专著:沿“指令微调 → 奖励模型 → 强化学习”主线,覆盖 DPO、RLVR、合成数据、过度优化与模型性格塑造
朋友,Nathan Lambert 写了一本 RLHF 的系统专著,从指令微调讲到强化学习,还覆盖了 DPO、RLVR 这些具体方法,核心论点是数据比算法重要,书和代码都开源了。
8月11日
Nathan Lambert 新书专讲大模型 RLHF,配套 13 讲课程免费
Nathan Lambert 出书讲 RLHF,还配了 13 讲免费课和 PPT,零基础也能跟着学,想入门后训练可以看看。