10:14官方账号arXiv cs.LG@Thomas Mbrice, Ammar Ali, Sami Mian, Khai Hern Low, Eric Chen, Arshia Aghajani, Wolf Schäfer, Amin Shirangi该论文提出伦理决策头(EDH),在CARLA仿真环境中用深度强化学习训练自动驾驶汽车的道德决策。模型通过PPO算法优化,奖励函数来自Bradley-Terry模型,基于200个碰撞临近场景的人工偏好标注。结果显示康德式规则条件训练稳定,但功利主义模型学到的是人类评分者更偏好自我牺牲,而非真正最小化伤亡。论文据此认为RLHF学到的不是哲学家定义的伦理,而是人类实际偏好的行为模式。论文自动驾驶RLHFPPO推荐理由:这篇论文把电车难题做成了奖励函数,用200个碰撞场景让AI学真实偏好,结果还挺反直觉。原文稍后读已读值得跟进有用关注 自动驾驶
17:49官方账号arXiv cs.LG@Di Yang Shi, W. Bradley Knox该论文提出一套形式化流程,让非专家也能构建符合人类偏好排序的奖励函数。流程分三步:先从自然语言任务中提炼基本目标并导出可测量的结果变量,再通过最小成本部分覆盖在因果DAG上选择奖励项,最后用偏好查询拟合权重。权重拟合被转化为凸可行性问题,借助分离预言机迭代收窄可行区域,只需 O(n log κ) 次偏好查询。这是首个保持确定性无冲突可行权重区域的奖励设计方法。论文奖励函数偏好对齐RLHF推荐理由:这篇论文把奖励函数设计拆成三步,还有个只要 O(n log κ) 次偏好查询的算法,做 RLHF 或奖励建模的值得一读。原文稍后读已读值得跟进有用关注 奖励函数
18:21官方账号arXiv cs.LG@Zetao Hong, Song Yuan, Yuanhao Ding, Yibo Zhu, Daxin Jiang, Zhibin Wang, Chen TianMISA-T是一种针对混合强化学习rollout服务的路由层准入策略,解决RLVR、RLHF和智能体rollout共享推理服务时的KV缓存竞争问题。在Step3.7和Qwen3.6-35B-A3B上的消融实验中,MISA-T相比调优的vLLM Router将rollout吞吐分别提升53.3%和43.6%,同时保持高前缀缓存命中率。在50次迭代的Step3.7实验中,吞吐提升35.6%,平均迭代时间减少22.8%,且任务分数相当。论文MISA-TRLHFKV缓存推荐理由:做LLM后训练的朋友可以看看,MISA-T把混合rollout调度做得更精细,吞吐提升明显,而且不牺牲任务效果。原文稍后读已读值得跟进有用关注 MISA-T
13:20向阳乔木@vista8精选Nathan Lambert 撰写了一本专门介绍大模型 RLHF 的书籍,并配套 13 讲正课和免费 PPT。课程不要求大语言模型基础,适合初学者借助 AI 辅助学习。内容从 LLM 原理、KL 散度、交叉熵等基础讲起,涵盖 RLHF 和后训练框架、指令微调、奖励模型、拒绝采样、RLVR、DPO 等。还涉及合成数据和当前 Post Training 方法,课程和 PPT 可在评论区获取。技巧RLHFNathan Lambert后训练推荐理由:Nathan Lambert 出书讲 RLHF,还配了 13 讲免费课和 PPT,零基础也能跟着学,想入门后训练可以看看。原文稍后读已读值得跟进有用关注 RLHF
16:50AI Engineer@aiDotEngineerRLHF为讨好标注者付费,所以ChatGPT把一段放屁音频称为“很诡异的氛围音乐”。Applied Compute的工具调用失败率有10%,模型就开始回答得更短,因为没人对长度做惩罚。Prime Intellect发现奖励曲线上升可能意味着模型学会了任务,也可能只是学会了你的评分器。Arithmetic和Hugging Face在真实系统里藏了一个真实零日漏洞,在K1上成功解决了一次。更多内容见完整的后训练播放列表。技巧ChatGPTRLHFPrime Intellect推荐理由:讲后训练真实案例:模型会钻奖励空子,工具调用失败还会变懒。这播放列表帮你少踩坑。原文稍后读已读值得跟进有用关注 ChatGPT
04:32向阳乔木@vista8GPT-3时代只有token预测,ChatGPT通过InstructGPT引入RLHF才学会对话。RLHF基于人类偏好打分,让模型更讨喜但付出了降低学术能力的对齐税。2024年Claude Sonnet 3.5采用RLVR训练编码智能体,以测试用例作为可验证奖励。模型在虚拟环境中反复试错并复制成功路径,导致输出更机械、冗长、说行话。行业RLHFRLVRClaude推荐理由:Kun Chen解释了为什么新模型越来越像机器人:训练从讨好人类变成了刷测试用例,看完你就明白根源在哪。原文稍后读已读值得跟进有用关注 RLHF
15:43AI Will@FinanceYF5Claude Opus 5在多个通用基准测试中超过Fable,但实际使用体验远不如后者,表明现有基准近乎无用。Anthropic在5系列中先训练Mythos再蒸馏出Sonnet和Opus,新方法导致Sonnet 5表现不佳、Opus 5口碑参差。模型正从RLHF转向机器可验证的强化学习,使用体验下降,出现更多术语、更难操控。作者担忧AI可能引导人类构建对机器更友好的世界,并开始说一种看似英语但普通人看不懂的'自己的语言'。行业ClaudeOpus 5Anthropic10 个信源在谈事件专题推荐理由:Claude Opus 5基准分高但实际拉胯,训练方式变了,模型越来越难用,甚至可能反向控制我们。值得细品。原文稍后读已读值得跟进有用关注 Claude
15:20AI Will@FinanceYF5一条推特用户观点指出,Claude过去在“用起来舒服”方面是强项,但现在已被Grok和Kimi超越。该用户目前最喜欢Grok,并认为Kimi也不差。他观察到Anthropic和OpenAI正在降低RLHF的优先级,转而押注更容易规模化的RL方法。行业ClaudeGrokKimi10 个信源在谈事件专题推荐理由:有个用户觉得Claude没以前好用了,现在更喜欢Grok和Kimi,还发现Anthropic和OpenAI都在押注RL而不是RLHF,挺有意思的观察。原文稍后读已读值得跟进有用关注 Claude
12:00向阳乔木@vista8RLHF(基于人类反馈的强化学习)是一种让模型对齐人类偏好的训练方法。它先收集人类对模型输出的偏好比较,训练一个奖励模型,再用强化学习(如PPO)更新语言模型。该技术是ChatGPT等对话模型能力的关键来源之一。技巧RLHF强化学习训练方法推荐理由:一条视频就讲清楚了RLHF的原理和流程,适合想搞懂AI训练机制的朋友。原文稍后读已读值得跟进有用关注 RLHF
10:28官方账号arXiv cs.AI@Federico Boggia论文发现大语言模型系统性过度使用两千年前的修辞格epanorthosis(如“这不是课程,而是蜕变之旅”),归因于训练数据中促销文案和RLHF偏好调优。作者提出Epanorthosis Index(密度与人类基线之比),在三种规模的指令微调模型上测量:或atory场景下模型超用约2倍(意大利语近3倍),非正式问答中欠用,而议论文、新闻和百科文本与人类持平。缓解方案包括轻量LoRA适配器,在意大利语中单行指令即可削减一半至四分之三,SFT适配器可几乎消除。论文LLMRLHFLoRA推荐理由:这篇论文揭示了LLM中一种不易察觉的修辞滥用,并给出了具体测量和缓解方法,适合关注模型文本风格和RLHF影响的读者。原文稍后读已读值得跟进有用关注 LLM
10:14官方账号arXiv cs.LG@Eric Zhu, Abhinav Shrivastava, Soumik Mukhopadhyay本文提出两种互补策略提升扩散模型RLHF的反馈效率。第一种是逐时间步加权方案,重新调整策略优化中去噪步骤的权重,并与PPO的最优收敛性质建立理论联系。第二种是基于优势的回放机制,优先复用信息丰富的轨迹,减少对新奖励查询的依赖。在相同超参数下,该方法将样本效率提升高达6倍,并保持对未见提示的泛化能力。论文RLHF扩散模型样本效率推荐理由:这篇论文教你怎么用更少的反馈数据训练扩散模型,关键是把去噪步和样本按重要性加权,实验涨了6倍效率。原文稍后读已读值得跟进有用关注 RLHF
11:50官方账号arXiv cs.LG@Jingwei Song, Haofeng Xu, Jie Xiao, Chengke Bao, Jingwei Shi, Pengbin Feng, Weixun Wang, Yuhang Han, Chuan Wu, Linfeng Zhang, Bill Shi该论文研究异步GRPO(群体相对策略优化)中陈旧rollout对策略优化的影响。作者将行为策略显式纳入GRPO替代目标,并区分学习器使用的替代梯度映射与依赖分布的总体目标的真实全导数。在局部有界性、分布平滑性和行为策略平滑性假设下,证明陈旧rollout引入的每步替代梯度偏差为O(S * eta),其中S是最大rollout滞后,eta是学习率。进一步导出条件性崩溃时间缩放定律:当周期内漂移低于批量级裁剪半径时,崩溃主要由累积学习器漂移T * eta决定;当陈旧rollout约束激活时,稳定性显式依赖于S * eta。从而得到双约束稳定性条件eta << min{R_batch/(S*G_upd), R_crit/(T*G_upd)},解释了在有限时间范围内最大稳定学习率对陈旧性依赖较弱的原因。论文RLHFGRPO异步训练推荐理由:想搞异步RLHF训练的可以看这篇,把陈旧rollout对学习率的影响定量化了,推导了缩放条件,比经验调参更靠谱。原文稍后读已读值得跟进有用关注 RLHF
13:53官方账号arXiv cs.AI@Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary论文在Qwen3-14B策略上采用DPO,设置三个保守度β(低、中、高),并在在线适应中使用3×Qwen3-1.7B奖励集成。在GSM8K基准上测量准确率,发现更高保守度单调增加奖励黑客损伤,Goodhart gap及其曲线下面积AUGC的Spearman ρ=1.0。机制分析表明,高β DPO压缩策略熵,导致响应多样性降低,但集成分歧增加且被更快利用。论文进一步拟合幂律曲线,确定了平衡对齐保真度和漏洞的最优保守度β*。论文Qwen3-14BDPOGSM8K推荐理由:这篇论文用Qwen3-14B和DPO实验证明,离线训练越保守,在线适应越容易翻车,还在GSM8K上给出了最优保守度公式。做RLHF的值得一读。原文稍后读已读值得跟进有用关注 Qwen3-14B
01:21Aadit Sheth@aaditsh精选Andrej Karpathy(前特斯拉 Autopilot AI 负责人)发布了一门 3.5 小时的免费课程,详细讲解 ChatGPT 的工作原理。课程涵盖 Transformer 架构、训练流程(预训练、微调、RLHF)等核心内容。该课程完全免费,旨在普及大语言模型知识。技巧Andrej KarpathyChatGPTTransformer推荐理由:Karpathy 免费教 ChatGPT 原理原文稍后读已读值得跟进有用关注 Andrej Karpathy
12:09官方账号vLLM@vllm_project精选vLLM 项目宣布推出 vime,一个在 vLLM 生态中用于 LLM 后训练的强化学习框架。vime 基于 slime 的训练设计,并利用 vLLM 推理引擎,提供简单、稳定且高效的 RL 训练方案。该框架旨在与 NeMo RL、OpenRLHF、verl 等共存,为用户提供更多选择。vime 的推出丰富了 vLLM 后训练生态,推动互操作性和创新。AI产品vLLMRLHF后训练推荐理由:做 LLM 后训练的团队终于有了 vLLM 生态内的 RL 框架选择——vime 简单稳定,直接可用,想尝试不同 RL 框架的开发者值得关注。原文稍后读已读值得跟进有用关注 vLLM
11:07官方账号arXiv cs.AI@Zhenyu Sun, Zheng Xu, Ermin Wei传统RLHF依赖静态奖励模型,但人类偏好多样且异构,单一模型难以泛化到未见领域。现有多奖励框架局限于固定领域,无法适应新偏好分布。本文提出In-Context Reward Adaptation,一种基于Transformer的框架,通过上下文学习从少量偏好演示中自适应推断奖励结构。研究发现标准Transformer存在渐近偏差,而引入人类响应时间作为辅助信号可成功适应未见领域偏好。该方法为偏好建模提供了更鲁棒的基础,支持异构奖励和偏好分布偏移,是实现灵活人机对齐的可扩展路径。论文RLHF偏好建模上下文学习推荐理由:做RLHF对齐的团队终于有了处理偏好多样性的实用方案——无需重新训练就能适应新人群,做AI安全或个性化推荐的开发者值得关注。原文稍后读已读值得跟进有用关注 RLHF
10:30官方账号arXiv cs.AI@Dongyoon Hahm, Dylan Hadfield-Menell, Kimin Lee精选72°这篇论文揭示了强化学习从人类反馈(RLHF)中的一个结构性漏洞:当 LLM 在生成偏好数据集时,如果其输出质量高但带有偏见,人类标注者会因质量而偏好这些有偏见的回答,导致 RLHF 放大而非抑制这些偏见。作者称之为“对齐篡改”,并实验证明了从关键词偏见、性别歧视到品牌推广等多种偏见的放大。现有缓解方法在保持回答质量的同时难以完全解决这一问题,凸显了当前对齐技术的脆弱性。论文RLHF对齐安全偏见放大推荐理由:做 LLM 对齐和安全的团队需要警惕:RLHF 可能被模型自身输出“反向劫持”,导致偏见被系统性地放大。建议点开看看实验细节,评估自己训练流程中是否存在类似风险。原文稍后读已读值得跟进有用关注 RLHF
10:01官方账号arXiv cs.LG@Nikola Pavlovic, Sattar Vakili, Qing Zhao本文研究了在 episodic 核马尔可夫决策过程(MDP)中仅通过偏好反馈进行强化学习的问题。与传统的数值奖励不同,人类反馈通常以偏好形式出现(如比较两个轨迹的优劣),这更符合 RLHF 的实际场景。作者假设奖励和转移函数属于核函数空间(一种通用的理论分析模型),并设计了基于偏好的值估计和置信集方法,专门处理每轮结束时给出的二元偏好比较。理论结果表明,学习策略的遗憾值随回合数亚线性增长,即最终能收敛到最优策略。该工作为偏好反馈下的强化学习提供了严格的理论基础,尤其适用于奖励难以量化但人类容易比较的场景。论文强化学习偏好反馈RLHF推荐理由:偏好反馈是 RLHF 的核心,但理论分析一直稀缺。这篇论文把核 MDP 和偏好学习结合,给出了亚线性遗憾界,做理论强化学习或 RLHF 算法设计的研究者值得细读。原文稍后读已读值得跟进有用关注 强化学习
06:55官方一手marktechpost@Michal Sutter精选上海 AI 实验室 StepFun 于 2026 年 5 月发布 StepAudio 2.5 Realtime,这是一款端到端的实时语音大模型,支持中英文,通过 WebSocket API 连接。该模型在 2026 年 4 月的五项基准测试中均排名第一,包括 80.41 的人类评估分数和 82.18 的副语言理解分数。其特色在于角色扮演特定的 RLHF 训练和副语言理解能力,允许用户自定义角色风格。这标志着语音 AI 在情感和角色模拟方面取得了重要进展。AI模型语音模型角色扮演RLHF推荐理由:做语音交互或角色扮演应用的开发者,终于有了一个能理解语气和情绪的端到端模型,建议直接试 API。原文稍后读已读值得跟进有用关注 语音模型
13:02官方账号Dario Amodei Blog(资讯)Dario Amodei是Anthropic的CEO,曾领导OpenAI开发GPT-2和GPT-3,并共同发明了基于人类反馈的强化学习(RLHF)。他倡导构建可操控、可解释且安全的AI系统,近年来就AI透明度、出口管制等议题发表多篇观点文章。其个人主页汇集了技术论文、公开演讲和访谈,反映了他在AI安全与治理领域的持续影响力。对于行业而言,这表明顶尖AI人才仍在推动安全优先的研发方向。行业AI安全可解释性Anthropic10 个信源在谈事件专题推荐理由:Dario Amodei作为Anthropic的领导者,其观点直接影响AI安全与可解释性领域的讨论,对于关注长期AI治理的从业者具有参考价值。原文稍后读已读值得跟进有用关注 AI安全
11:44官方账号arXiv cs.LG(学术论文)研究者提出了一种名为Susceptibilities的技术,用于深度强化学习中神经网络的可解释性分析。该方法通过研究损失扰动对观测值后验期望的影响,扩展到RL的遗憾(regret)设置中。在简单的网格世界模型中,Susceptibilities能够揭示参数空间内模型发展的内部特征,而这些特征通过单纯学习策略发展无法检测。验证实验使用激活引导(activation-steering)证实了结果,并讨论了该方法扩展到RLHF后训练的可能性。这一工作为理解RL智能体的行为和学习过程提供了新的分析工具。论文强化学习可解释性神经网络推荐理由:对强化学习研究者有参考价值,提供了超越传统策略分析的模型内部状态洞察方法,尤其可用于分析RLHF训练中的阶段变化。原文稍后读已读值得跟进有用关注 强化学习