#RLHF
做微调的朋友可以看看:LESSER 只用输出层梯度就能做数据选择,SFT 成本砍到近十分之一,效果不掉,还提供了 drop-in 接口。
Meta 把 RL 那套可验证奖励搬进了写作:先让 Kimi-K2.6 自动生成能区分专家和 AI 的评分标准,再用它训练 Qwen3.5-27B,盲评 95% 胜率打赢人类专家文本。
斯坦福这门新课 9 讲把 LLM 从 RoPE 到 RLHF、MCP 全讲一遍,第一讲课件和视频已经免费公开,自学党可以直接开刷。
AWS 官方给出了在 EKS 上跑 MoE 强化学习的架构,用 EFA 加 DeepEP 把 RLHF/GRPO 训练吞吐量提高了 40%,自建训练集群的可以抄作业。
Claude 写作为啥越来越怪?Anthropic 微调工程师亲口解释了原因,还透露 Opus 5.5 有改善,写作者值得看看。
朋友,Nathan Lambert 写了一本 RLHF 的系统专著,从指令微调讲到强化学习,还覆盖了 DPO、RLVR 这些具体方法,核心论点是数据比算法重要,书和代码都开源了。
Nathan Lambert 出书讲 RLHF,还配了 13 讲免费课和 PPT,零基础也能跟着学,想入门后训练可以看看。
有个用户觉得Claude没以前好用了,现在更喜欢Grok和Kimi,还发现Anthropic和OpenAI都在押注RL而不是RLHF,挺有意思的观察。
这篇论文揭示了LLM中一种不易察觉的修辞滥用,并给出了具体测量和缓解方法,适合关注模型文本风格和RLHF影响的读者。
这篇论文用Qwen3-14B和DPO实验证明,离线训练越保守,在线适应越容易翻车,还在GSM8K上给出了最优保守度公式。做RLHF的值得一读。
做 LLM 后训练的团队终于有了 vLLM 生态内的 RL 框架选择——vime 简单稳定,直接可用,想尝试不同 RL 框架的开发者值得关注。
做RLHF对齐的团队终于有了处理偏好多样性的实用方案——无需重新训练就能适应新人群,做AI安全或个性化推荐的开发者值得关注。
做 LLM 对齐和安全的团队需要警惕:RLHF 可能被模型自身输出“反向劫持”,导致偏见被系统性地放大。建议点开看看实验细节,评估自己训练流程中是否存在类似风险。
偏好反馈是 RLHF 的核心,但理论分析一直稀缺。这篇论文把核 MDP 和偏好学习结合,给出了亚线性遗憾界,做理论强化学习或 RLHF 算法设计的研究者值得细读。
做语音交互或角色扮演应用的开发者,终于有了一个能理解语气和情绪的端到端模型,建议直接试 API。
对强化学习研究者有参考价值,提供了超越传统策略分析的模型内部状态洞察方法,尤其可用于分析RLHF训练中的阶段变化。