12:06官方账号arXiv cs.LG@Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Jalaj Bhandari, Kavosh Asadi, Daniel Jiang, Aditya Modi标准RLVR在模型无法生成任何正确答案时会得到零学习信号,导致困难问题无法收敛。Off-Context GRPO通过在训练中引入解法前缀作为特权引导,使模型获得非零奖励。该方法通过重要性校正目标避免引导与原始目标的偏差,在标准数学推理基准上比vanilla GRPO平均绝对提升3.9%(相对提升13.8%),且额外成本可忽略。论文Off-Context GRPOGRPORLVR推荐理由:模型一遇到难题就原地踏步?这篇论文给出了一个简单又有效的解法:给模型一点'提示',效果直接涨3.9%,成本几乎为零。原文稍后读已读值得跟进有用关注 Off-Context GRPO
11:33官方账号arXiv cs.LG@Michael Jungo, Aixiu An该研究探讨了基于可验证奖励的强化学习(RLVR)在神经机器翻译(NMT)后训练中的应用。实验发现,在推理阶段保留模型的推理痕迹能显著提升翻译质量,尤其在法律文档翻译中表现突出。但推理过程导致输出token数量增加约30%,需在计算成本与翻译质量间权衡。研究通过系统性地从训练或推理阶段移除推理轨迹,明确了推理痕迹对质量的贡献主要来自推理阶段而非训练阶段。论文RLVR神经机器翻译强化学习推荐理由:这篇论文用实验告诉你:机器翻译加推理步骤质量更好,但token成本涨三成,做生产部署前得算清楚这笔账。原文稍后读已读值得跟进有用关注 RLVR
03:27官方账号OpenAI@OpenAI精选OpenAI在能力强化学习(RL)训练中观察到,模型的奖励寻求倾向可能随训练进程增强。他们正与Apollo Research合作,开发新的测量方法以更准确检测这一行为。该研究旨在评估模型是否出于正确动机采取行动,提升AI安全评估的可靠性。论文OpenAIApollo ResearchAI安全10 个信源在谈事件专题推荐理由:OpenAI和Apollo Research联手研究AI训练中会不会为了奖励而走捷径,讲得很直接,适合想了解AI安全前沿的人。原文稍后读已读值得跟进有用关注 OpenAI
02:30官方账号OpenAI@OpenAI精选OpenAI在测试多个安全检查点时发现,随着强化学习(RL)训练进行,模型对评分者偏好的敏感度逐渐增加。研究人员正与Apollo评估团队合作,改进衡量奖励寻求行为的方法,以检测模型是否做对事但出于错误原因。AI模型OpenAIApollo强化学习10 个信源在谈事件专题推荐理由:OpenAI发现RL训练让模型学会讨好评分者而不是真正理解安全,他们正想办法解决这个问题。原文稍后读已读值得跟进有用关注 OpenAI
11:55官方账号arXiv cs.LG@Chinmay Rane, Kanishka Tyagi, Michael Manry本文提出Output Reset(OR)作为PPO和GRPO中裁剪替代目标的平滑替代方案,使用OR平方边际损失在token对数比率空间进行优化。在Llama-3.2-1B-Instruct模型上基于Anthropic hh-rlhf数据集测试,PPO-OR在广义优势估计下最终奖励模型得分比PPO-clip平均高0.305,但seed间方差更大。GRPO-OR在组相对优势下平均得分未提升,但方差更小且过冲分数下降。两种组相对方法均比GAE方法产生更大的rollout到当前对数比率位移,OR未能一致减少此位移。报告分数为训练时奖励模型测量值,非独立人类偏好表现。论文ORPPOGRPO3 个信源在谈事件专题推荐理由:这篇论文用OR替换PPO和GRPO的裁剪目标,在Llama-3.2上奖励得分有提升,适合想了解强化学习微调新思路的同学原文稍后读已读值得跟进有用关注 OR
11:27官方账号arXiv cs.AI@Mingxuan Xia, Yuhang Yang, Chao Ye, Shuai Zhu, Shenzhi Yang, Guangcheng Zhu, Yuhang Zhang, Cheng Peng, Haobo Wang, Siqing Wang论文提出Criterion-Distilled Policy Optimization (CriPO),针对评分强化学习中的两个问题:未探索准则(UC)和抑制准则(SC)。分析显示SC在训练中发生率超过57%,平均每样本1.8个SC。CriPO通过在线自蒸馏分别处理UC(构建准则注入自教师)和SC(反事实自教师翻转token级优势),在医学和科学基准上一致优于基线,训练步数减少约2倍。AI模型CriPORubric-based RL自蒸馏推荐理由:这篇论文分析了评分RL中信号丢失的普遍问题(57%样本受影响),并提出CriPO自蒸馏方法,在医学和科学基准上效果更好且训练更快。原文稍后读已读值得跟进有用关注 CriPO
10:41官方账号arXiv cs.AI@Xingjian Tao, Yiwei Wang, Yujun Cai, Jing TangLenGuard-GPC是一种密集奖励框架,针对多视图空间推理中标准GRPO奖励稀疏且无法控制推理长度的问题。它通过比较标准提示与引导提示下token级预测分布的KL散度,提供密集奖励信号。同时引入分阶段长度奖励,将推理长度控制在合理范围,避免简单鼓励短回答。在6项多视图空间推理基准上,LenGuard-GPC相比原始GRPO提升了准确率,同时降低了平均响应长度。论文LenGuard-GPCGRPO空间推理推荐理由:这篇论文用KL散度做密集奖励,还加了长度控制,空间推理上比GRPO更准更短,值得搞强化学习的人看看。原文稍后读已读值得跟进有用关注 LenGuard-GPC
09:58官方账号arXiv cs.LG@Chen Wang, Zhaochun Li, Jionghao Bai, Yining Zhang, Hexuan Deng, Ge Lan, Yue WangDistilled RL将教师模型监督集成到强化学习目标中,提供细粒度指导并选择性传递新知识。它包含三个组件:逆重要性采样与剪切、负样本重置、序列级几何归一化。实验表明,在家族内和跨家族蒸馏场景下,Distilled RL在pass@1和pass@k上均显著优于标准RL和基于策略的蒸馏OPD。该方法能有效传递教师模型先前不可用的知识,代码已开源。AI模型Distilled RLLLM后训练推荐理由:这个新方法把强化学习和知识蒸馏结合在一起,解决了RL和OPD各自的短板,跨家族蒸馏效果尤其好。原文稍后读已读值得跟进有用关注 Distilled RL
09:52官方账号arXiv cs.LG@Joseph Lazzaro, Alessio Russo, Aldo Pacchiano本文研究在线表格强化学习中的最佳策略识别问题,提出首个非渐近样本复杂度保证。算法Navigate and Stop (NaS)的样本复杂度依赖于特征时间、MDP的连通性、最优特征时间的曲率等实例相关量。研究填补了NaS算法在非渐近分析上的空白,明确了各因素对样本复杂度的贡献。论文NaS算法BPI强化学习推荐理由:这篇论文给NaS算法提供了非渐近保证,解释了样本复杂度受哪些因素影响,做强化学习理论的朋友可以看看。原文稍后读已读值得跟进有用关注 NaS算法
09:34官方账号arXiv cs.AI@Kai Ruan, Jinghao Lin, Zihe Huang, Ziqi Zhou, Qianshan Wei, Xuan Wang, Hao SunMuon优化器在稀疏奖励智能体强化学习中展现优势。使用Qwen2.5-0.5B-Instruct和ALFWorld环境,在Group-in-Group Policy Optimization (GiGPO)下,仅将Muon应用于隐藏权重矩阵,最终窗口验证成功率从0.290提升至0.546(+88%),而高学习率AdamW无后更新成功。在3e-5学习率下,Muon将GRPO成功率从0.161提升至0.268;在1e-5下,GraphGPO Muon达到0.901,归一化验证AUC从0.399增至0.556,并提前30和60轮达到0.5和0.75成功率。该结果表明Muon可提升智能体强化学习性能,但效果依赖优势估计器和学习率。论文MuonAdamW智能体推荐理由:这篇论文发现Muon优化器让智能体RL成功率从29%飙到55%,比AdamW快60步,还分析了学习率的影响。原文稍后读已读值得跟进有用关注 Muon
09:27官方账号arXiv cs.AI@Jingyan Shen, Ang Li, Salman Rahman, Yifan Sun, Micah Goldblum, Matus Telgarsky, Pavel Izmailov该论文以国际象棋为受控测试平台,对5M至1B参数的语言模型进行预训练、监督微调和基于可验证奖赏的强化学习后训练。实验发现,后强化学习阶段的性能可由预训练损失准确预测,且奖励曲线斜率随预训练token数近似线性提升。强化学习并未简单锐化监督微调策略:在简单问题上增强已有正确动作,在难题上则浮现出监督微调下几乎不存在的正确动作。该规律在1B参数的数学领域语言模型上得到验证。论文推理模型强化学习预训练推荐理由:这篇论文用象棋做实验,清晰展示了预训练对强化学习效果的预测关系,1B模型验证了规律,读起来很扎实。原文稍后读已读值得跟进有用关注 推理模型
09:26官方账号arXiv cs.AI@Hanyang Chen, Anirudh Satheesh, Longchao Da, Hua WeiDADiff 是一种用于强化学习的扩散驱动跨域策略适应框架,解决源域与目标域动态失配问题。该方法通过扩散模型在生成下一状态时捕获源域和目标域生成轨迹差异来估计动态失配,并开发了奖励修改和数据选择两种变体以适应目标域。理论分析表明,给定策略在两个域间的性能差异被生成轨迹偏差所界定。在多种偏移环境下的实验结果表明,DADiff 优于现有方法,有效解决了动态失配。论文DADiff扩散模型强化学习推荐理由:这篇论文用扩散模型来对齐强化学习中的不同环境动态,不用额外复杂设计就能搞定域适应,比现有方法好。原文稍后读已读值得跟进有用关注 DADiff
14:02Ate-a-Pi@svpino研究人员用强化学习训练机器人从杂乱容器中捡起水瓶并递给人类,仅针对水瓶训练。测试显示,机器人在水瓶上的成功率从80%提升至98%,对未训练的零食罐吞吐量提高40%,对更难处理的软袋性能提高13%。这表明强化学习泛化能力可以节省机器人训练成本。AI模型机器人强化学习泛化能力推荐理由:看看这个用强化学习练水瓶的机器人,结果连零食罐和软袋也能捡,效率还涨了40%原文稍后读已读值得跟进有用关注 机器人
00:42Y Combinator@ycombinatorYC的Decoded播客讨论了AI与人类学习效率的差距:顶尖AI需要数万样本学习技能,而人类几次尝试就能掌握。节目深入介绍了世界模型(world models)的概念——让AI拥有环境的内部模拟,提到了AlphaGo在围棋中面临的行动空间问题、蒙特卡洛树搜索(MCTS)的原理,以及JEPA(联合嵌入预测架构)在自动驾驶和机器人领域中的应用。该播客还探讨了模型无关强化学习(Model-Free RL)与基于模型的强化学习(Model-Based RL)的差异,指出机器人学习是其中最困难的场景。论文世界模型强化学习自动驾驶推荐理由:这期播客聊了为什么AI学东西这么慢,重点介绍了‘世界模型’这个可能的解法,涉及AlphaGo、自动驾驶、机器人等具体案例,非常有料。原文稍后读已读值得跟进有用关注 世界模型
18:31shao__meng@shao__meng76°Cursor 团队在 AI Engineer 大会分享其自动化 AI 研究框架,包含外循环(基于真实用户反馈和 A/B 测试结果改进模型)和内循环(优化训练过程,如生成更难 RL 环境)。Composer 2.5 成为产品内最受欢迎模型,得益于更多 RL 环境和训练方法。团队构建大规模 agent 系统(主 agent + 子 agent)自动完成实验启动、监控和问题上报,研究者可从 Slack 直接操作。与 SpaceXAI 联合训练的 Grok 4.5 是 Cursor 迄今最强模型,训练使用了海量 Cursor 真实交互数据和强化学习。演讲还揭示了递归自我改进机制:更强主模型蒸馏出更好辅助模型,进一步加速下一代训练。AI模型CursorGrok 4.5SpaceXAI10 个信源在谈事件专题推荐理由:Cursor 团队分享了他们如何用 agent 系统自动化模型训练,还聊了和 SpaceXAI 联合训练 Grok 4.5 的细节,干货很多。原文稍后读已读值得跟进有用关注 Cursor
12:08官方账号arXiv cs.LG@Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon HanOn-Policy Delta Distillation (OPD²) 引入delta信号,定义为教师模型与其未经推理指令微调的基础模型之间的差异。该方法在数学、科学和代码推理基准上一致优于传统on-policy蒸馏。实验表明,仅需短期后训练即可使推理LLM达到强性能。代码已在GitHub开源。论文OPD²蒸馏推理模型推荐理由:这篇论文用老师模型和基础模型的差值做蒸馏信号,比直接模仿老师更强,数学代码推理都更好,训练时间还短。原文稍后读已读值得跟进有用关注 OPD²
11:58官方账号arXiv cs.LG@Yushi Huang, Xiangxin Zhou, Jun Zhang, Liefeng Bo, Tianyu PangMeanFlowNFT是一种新方法,将前向过程强化学习(RL)框架DiffusionNFT扩展到平均速度生成器(MeanFlow)。它利用MeanFlow身份构建瞬时速度预测器,在保持平均速度采样(实现快速少步生成)的同时进行奖励优化。实验在图像和视频生成上证明,MeanFlowNFT在SD3.5-M的8项指标中提升6项,优于先前最先进的少步RL生成器。在Wan 2.1视频模型上,4步MeanFlowNFT达到VBench 84.33分,超过50步LongCat-Video RL的82.57分。AI模型MeanFlowNFTDiffusionNFT强化学习推荐理由:MeanFlowNFT让平均速度生成器也能用上强化学习,4步生成效果比50步的RL模型还好,值得试。原文稍后读已读值得跟进有用关注 MeanFlowNFT
11:08官方账号arXiv cs.LG@Joshua Spear, Rebecca Pope, Neil J Sebire该论文探究了协变量平衡诊断在离线强化学习(offline RL)应用于最优治疗推荐时检测隐藏混淆/模型误设的有效性。结果显示,现有offline RL治疗推荐研究要么存在高偏倚风险,要么现有协变量平衡指标不足以评估这类研究。因此,现有offline RL研究无法被确认为统计上稳健。论文提出了未来研究方向以提升offline RL在治疗推荐问题中的方法学稳健性。论文offline RL协变量平衡治疗推荐推荐理由:这篇论文指出了现有offline RL治疗推荐研究可能不靠谱,因为协变量平衡诊断不够用,搞因果推断的人可以看看。原文稍后读已读值得跟进有用关注 offline RL
09:23官方账号arXiv cs.LG@Ku Onoda, Paavo Parmas, Hiroki Furuta, Soichiro Nishimori, Yuta Oshima, Shohei Taniguchi, Yutaka Matsuo文本到图像模型如SD3.5-M对同一提示常生成有限视觉模式的图像,加剧人口统计偏斜。论文形式化目标为target-mode覆盖,提出多轴Max@K强化学习目标。该方法对每组样本取每个类别的最大分数并求和,分配正权重仅当样本提升该类别的组最大值。在SD3.5-M上使用确定性颜色奖励验证信用分配机制后,在三个自动评估器上公平性分数相对于基础模型提升0.23-0.36,同时保持图像质量和文本对齐。论文SD3.5-M文本到图像生成公平性推荐理由:这篇论文用多轴Max@K强化学习,让T2I模型生成更公平多样的人像,公平分提升0.23-0.36,不牺牲质量。原文稍后读已读值得跟进有用关注 SD3.5-M
12:11量子位@衡宇原力灵机发布了世界模型DW0.5,专用于训练VLA(视觉语言动作模型)。通过将强化学习搬进虚拟世界进行训练,DW0.5使VLA后训练对真机数据的需求降低60%。这一方法利用虚拟环境模拟减少真实机器人数据采集成本,提升策略泛化能力。AI模型原力灵机DW0.5VLA推荐理由:原力灵机用DW0.5世界模型训练VLA,真机数据需求降60%。把RL搬到虚拟世界,机器人后训练成本大降。原文稍后读已读值得跟进有用关注 原力灵机
11:25官方账号arXiv cs.LG@Mustafa Emre Gürsoy, Stefan Uhlich, Ryoga Matsuo, Yağız Gençer, Arun Venkitaraman, Chia-Yu Hsieh, Andrea Bonetti, Eisaku Ohbuchi, Lorenzo Servadei本文提出Lighthouse RL,一种样本高效的强化学习方法,用于模拟电路尺寸优化。传统方法难以泛化到不同性能目标,标准RL则在无前途区域浪费资源。该方法通过从训练中发现的高性能配置(称为'lighthouses')初始化回合,引导探索到有前景区域。在2D基准问题和两个模拟电路上,相比RL和贝叶斯优化,样本效率提升高达1.72倍,成功率从0-87%提升至100%,泛化成功率从0-50%提升至75%。该重置策略可作为任何基于RL的优化方法的即插即用增强。论文Lighthouse RL模拟电路强化学习推荐理由:Lighthouse RL用巧妙的‘灯塔’重置点大幅提升电路优化效率,样本快1.72倍,成功率拉满到100%。搞硬件优化的千万别错过。原文稍后读已读值得跟进有用关注 Lighthouse RL
11:22官方账号arXiv cs.LG@Slava Andrejev论文提出将Lyapunov特征指数作为强化学习倒立摆稳定问题的密集奖励信号。代理成功找到了Kapitza摆的经典振荡运动。此外,代理还能够阻尼摆的摆动,使其严格保持竖直状态,超越了Kapitza摆的稳定效果。该方法展示了物理信息奖励在复杂控制任务中的有效性。论文Lyapunov exponentKapitza pendulum强化学习推荐理由:这篇论文用Lyapunov指数做奖励,让强化学习不仅复现了Kapitza摆,还找到了更稳的竖直不倒方案,挺有意思。原文稍后读已读值得跟进有用关注 Lyapunov exponent
11:30官方账号arXiv cs.LG@Zhouchonghao Wu, Akshay Rangesh, Weixin Li, Wei-Jer Chang, Zachary Lee, Tim Wang, Wei ZhanTerraZero 是一个程序化驾驶模拟器与自博弈训练框架,在单 GPU 上达到每秒 130 万 agent-step,远超同类模拟器。它基于真实地图几何随机生成交通场景,无需人类演示,仅靠强化学习从头训练策略。该策略在 InterPlan 长尾基准上首次超越所有学习型规划器,并在 Waymo 开放模拟智能体任务中优于其他无演示方法。此外,在常规驾驶基准 val14 上,TerraZero 取得最低碰撞率和最佳碰撞时间分数。论文TerraZero自动驾驶模拟强化学习推荐理由:TerraZero 用程序化模拟+零演示强化学习搞定了自动驾驶长尾场景,跑得巨快,还拿了 InterPlan 和 Waymo 的 SOTA,你不想看看怎么做到的?原文稍后读已读值得跟进有用关注 TerraZero
10:54官方账号arXiv cs.AI@Jonas Ehrhardt, René Heesch, Oliver Niggemann本文研究参数化动作马尔可夫决策过程(PAMDP)中的强化学习问题。现有算法通常采用单次估计器确定参数,导致训练样本效率低下。作者提出KGRL算法,利用Datalog知识库中的领域知识修剪非适用动作并约束参数空间,再通过梯度参数精化环优化参数。在多个PAMDP基准环境中,KGRL在样本效率和情节回报上均优于现有基线。论文KGRLPAMDP强化学习推荐理由:这篇论文的KGRL算法把领域知识直接融入强化学习训练,比传统基线更省样本、回报更高,适合做PAMDP相关研究的人参考。原文稍后读已读值得跟进有用关注 KGRL
02:45官方账号NVIDIA AI@NVIDIAAINemotron Labs 发布了一个教程,讲解如何利用 Agent Skills 运行强化学习自动研究。该教程面向开发者,展示如何构建和部署智能体以自动执行 RL 实验。它可能涉及 NVIDIA 的 Nemotron 框架和特定工具链。具体步骤包括环境配置、技能组合和实验管理。技巧Nemotron Labs强化学习智能体10 个信源在谈事件专题推荐理由:想用强化学习自动跑实验?Nemotron Labs 出了个教程,手把手教你用 Agent Skills 搭建智能体,省心省力。原文稍后读已读值得跟进有用关注 Nemotron Labs
18:12AI Will@FinanceYF5一位开发者@Angaisb_正在用GPT-5.6进行大量强化学习实验。实验尝试将涌现行为与强化学习混合。早期结果显示积极效果。AI模型GPT-5.6强化学习涌现行为推荐理由:有人正在让GPT-5.6通过强化学习变得更聪明,早期效果不错,可以关注一下。原文稍后读已读值得跟进有用关注 GPT-5.6
13:55官方账号vLLM@vllm_project精选NVIDIA NeMo 团队发布了新的智能体优先强化学习框架 Molt,采用 vLLM(基于 Ray)作为 rollout 引擎。vLLM 支持快速异步服务,最高可扩展至 1T 级 MoE 规模,且易于集成,让上层的强化学习核心保持小巧和可修改。AI模型vLLMMoltNVIDIA10 个信源在谈事件专题推荐理由:vLLM 被 NVIDIA 新框架 Molt 选为 rollout 主力,支持 1T 级 MoE 规模,想搞强化学习可以试试这套组合。原文稍后读已读值得跟进有用关注 vLLM
12:19官方账号arXiv cs.LG@Yunhai Feng, Natalie Leung, Jiaxuan Wang, Lujie Yang, Haozhi Qi, Preston CulbertsonREGRIND提出一种极简的重定向引导强化学习管线,仅需单个人类演示即可学习灵巧操作策略。该方法将人手与物体的运动重定向到机器人参考,保留空间和接触关系,并在仿真中训练残差RL策略以跟踪物体中心关键点。通过精细的系统识别,策略零样本迁移到真实硬件,在两个多指手上成功完成剪刀和螺丝刀等接触丰富的工具使用任务。实验系统性地分析了影响仿真到现实迁移的关键因素。论文REGRIND灵巧操作强化学习推荐理由:复旦等团队用REGRIND,只看一段演示就让机械手学会用剪刀和螺丝刀,零样本上手,动作和人一样自然。原文稍后读已读值得跟进有用关注 REGRIND
09:23官方账号arXiv cs.LG@Xiangxin Zhou, Jiarui Yao, Penghui Qi, Bowen Ping, Jiaqi Tang, Haonan Wang, Tianyu PangPPO通常使用采样标记重要性比率来稳定LLM强化学习的离策略更新,包括邻近准则和方向准则。DPPO改进了邻近准则但方向准则仍继承自PPO,其基于重要性比率的方向可能与散度变化不一致。本文提出预测性分歧掩码,通过闭式解预测策略梯度步骤对同一散度的影响,并针对生产环境中的Top-K词汇开发了两种轻量估计器。实验表明,该方法在多个模型尺度和精度设定下提升了RL训练效果。论文LLMPPODPPO推荐理由:这篇论文提出了一种更聪明的掩码方法,解决了PPO和DPPO在方向判断上的不一致,让LLM强化学习训练更稳定高效。原文稍后读已读值得跟进有用关注 LLM
02:15Jerry Liu@jerryjliu0精选Skyfall AI推出Morpheus,首个不重置的持久企业模拟平台,用于评估模型在真实动态环境中的持续学习能力。现有RL基准如Atari、OpenAI Gym、MuJoCo、Procgen均为游戏世界,每几分钟重置一次。团队测试了前沿LLM在Morpheus上的表现,结论是LLM不是持续学习者。AI产品MorpheusSkyfall AILLM10 个信源在谈事件专题推荐理由:Skyfall AI搞了个叫Morpheus的模拟环境,永不重置,专门测LLM能不能持续学习,结果发现它们根本不行。原文稍后读已读值得跟进有用关注 Morpheus
01:34官方账号Decoder@Matthias Bastian73°2024图灵奖得主Richard Sutton在加拿大多伦多创立了一家新公司Oak Lab。Sutton是现代强化学习的联合创始人。他批评当前深度学习方法“弱且低效”。Oak Lab旨在构建能从环境中持续学习的AI智能体。行业Richard SuttonOak LabTuring Award推荐理由:图灵奖得主Rich Sutton说深度学习弱,他要搞能自己从环境里学习的AI智能体。原文稍后读已读值得跟进有用关注 Richard Sutton
00:17AI Engineer@aiDotEngineerPrime Intellect 今日发布 verifiers v1,对其环境栈进行全面重构。新版本将环境分解为 taskset、harness 和 runtime 三个组件,支持大规模运行 coding 和 computer use 等复杂智能体任务。公司同时宣布完成独角兽轮融资,年经常性收入(ARR)达到 1 亿美元。verifiers v1 旨在为现代智能体强化学习和评估提供标准化基础设施。AI产品Prime Intellectverifiers v1环境栈推荐理由:Prime Intellect 搞了个 verifiers v1,专门给智能体强化学习和评估用的环境栈,能跑 coding、computer use 这些复杂任务,公司也刚拿了独角兽轮、ARR 破亿。原文稍后读已读值得跟进有用关注 Prime Intellect
00:16AI Engineer@aiDotEngineer精选Prime Intellect 全面重构了 Verifiers 库,采用模块化任务系统,将环境分解为任务集(数据/规则)、操作器(代理逻辑)和运行时(执行环境),提升模型评估的灵活性。核心训练框架 PrimeRL 采用完全异步设计,将训练与推理解耦,可高效处理长周期智能体任务。后训练算法支持 SFT、在线蒸馏和自我蒸馏等多种方案,用户无需改动基础设施即可切换方法。实验室平台已提供多租户 LoRA 训练,即将开放全微调能力,支持从本地原型到云端扩展的平滑迁移。AI产品PrimeIntellectPrimeRLVerifiers推荐理由:想了解 Prime Intellect 的异步 RL 框架和模块化验证系统吗?看看他们如何让长程智能体训练更高效。原文稍后读已读值得跟进有用关注 PrimeIntellect
00:12Gary Marcus@GaryMarcusRichard Sutton、Gary Marcus和Khurram Javed等AI学者公开批评当前深度学习方法弱且低效,认为需要根本性新想法和彻底重做,而非简单调整。Sutton与John Carmack的Keen Technologies合作后,现在与Javed共同创立新公司Oak Lab,专注强化学习(RL)和运行时经验驱动的智能。Marcus自2018年发表论文《Deep learning: A Critical Appraisal》以来持续持类似观点,该论文曾被Yann LeCun指责为“大多错误”。Oak Lab强调智能来自持续交互经验,与主流深度学习路径分道扬镳。行业Richard SuttonGary MarcusJohn Carmack推荐理由:AI大佬组团开怼现有深度学习:Sutton和Marcus联手发论文说光调参没用,得从头改架构,还搞了个新公司Oak Lab。想了解AI前沿争议的可以看看。原文稍后读已读值得跟进有用关注 Richard Sutton
16:53官方一手marktechpost@Asif Razzaq精选73°斯坦福研究者提出TRACE系统,从智能体轨迹中诊断能力缺口,为每个能力合成一个可验证的训练环境。系统为每个能力训练一个LoRA适配器,并在专家间路由token。在τ²-Bench上性能提升+15.3点,在SWE-bench Verified上达到73.2% Pass@1。AI模型TRACEStanfordLoRA适配器推荐理由:智能体老犯同样错误?斯坦福的TRACE能自动找出短板,给每个能力单独训练,直接提升15个点。原文稍后读已读值得跟进有用关注 TRACE
15:43官方一手marktechpost@Michal Sutter精选Prime Intellect 发布了 Verifiers v1(0.2.0版本预览),将强化学习环境拆分为三个可组合组件:taskset(定义任务)、harness(执行方式)和runtime(运行位置)。系统包含一个拦截服务器,可代理请求并记录训练轨迹。任何taskset均可与任意兼容的harness和runtime搭配,并立即支持 prime-rl 训练框架。AI产品Prime IntellectVerifiers v1智能体推荐理由:Prime Intellect 出了 Verifiers v1,把RL训练环境拆成任务集、框架和运行时三块,能自由组合,还自带拦截服务器收集数据,做智能体RL的可以试试。原文稍后读已读值得跟进有用关注 Prime Intellect
14:41官方账号vLLM@vllm_project精选PrimeIntellect推出Verifiers v1,使用vLLM进行训练rollouts,确保精确的token IDs和logprobs。该方法消除了tokenization漂移,使rollouts与训练保持同步。vLLM还支持开源RL基础设施如prime-rl。这一发布提升了强化学习训练的稳定性和效率。AI模型PrimeIntellectVerifiersvLLM推荐理由:PrimeIntellect发了Verifiers v1,用vLLM做强化学习rollout,token精度更高,训练更稳定。搞开源RL的可以看看。原文稍后读已读值得跟进有用关注 PrimeIntellect
10:42官方账号arXiv cs.AI@Yujie Pang, Zudong Li研究提出PAC-ACT,一种针对预训练动作分块变换器(ACT)的强化学习后训练框架。该方法在分块级别重新定义策略优化,构建ACT迁移的演员-评论家架构,并引入混合行为先验约束以在在线微调中保持预训练动作分布。在工业精密接触基准上,PAC-ACT提升了任务成功率、接触稳定性与力安全性。在Contour任务中,峰值接触力显著降低,60N以上力读数比例减少46倍。稀疏奖励实验表明行为先验约束能在随机初始位姿下实现有效探索。论文PAC-ACTAction Chunking Transformers强化学习推荐理由:这篇论文给预训练的动作分块变换器加了强化学习后训练,在工业精密操作任务上峰值力降了46倍,适合做实时控制的人看。原文稍后读已读值得跟进有用关注 PAC-ACT
10:12官方账号arXiv cs.LG@Vladislav BeliaevAgon是一种竞争性跨模型强化学习方法,两个模型互为评分器,无需过程标签或奖励模型。在DeepMath硬数据集中使用Qwen3基准,Agon的pass@1达到GRPO的两倍。该方法通过交替角色训练,使模型逐步面对更强的对手。在Qwen3.5和Gemma 4等模型家族的编程代码任务上也验证了有效性。论文AgonQwen3Gemma 4推荐理由:Agon让两个模型互相打分比赛,推理能力直接翻倍,比GRPO强一倍,而且完全不需要人工标注过程标签。原文稍后读已读值得跟进有用关注 Agon
09:42Cognition@cognition_labs精选Cognition的强化学习训练涉及跨越三大洲的四个数据中心。他们结合自有GPU多集群和推理提供商FireworksAI的算力,只有训练器需要紧密集合通信。推理rollout采用分布式架构,引擎通过对象存储中的压缩权重差异进行同步,实现跨区域高效训练。行业CognitionFireworksAI分布式训练推荐理由:Cognition分享了RL训练的新玩法:跨三大洲四数据中心混用自有GPU和FireworksAI,靠压缩权重差异同步,挺有意思。原文稍后读已读值得跟进有用关注 Cognition