论文73°11:07强化学习助力寻找新物理物理学家用强化学习自动寻找解释异常的标准模型算子,比人类分析更全面高效。#SMEFT#强化学习#新物理#粒子物理aarXiv cs.LG@Jacky Kumar 等 3 人原文稍后读已读值得跟进有用关注 SMEFT
论文Agent 与开发者精选09:33基因组工具选择的全组策略优化方法FGPO方法解决了基因组工具选择中的采样问题,比GRPO表现更好,还能减少计算资源消耗。#基因组#FGPO#GRPO#强化学习aarXiv cs.AI@Haoyue Liu 等 5 人原文稍后读已读值得跟进有用关注 基因组
论文Agent 与开发者精选73°09:31TRACE: 因果探索推理智能体训练方法TRACE用模拟验证解决诊断推理难题,让Qwen3.5-35B在数字广告诊断任务上超越Claude Opus 5。#TRACE#Qwen3.5#Claude Opus#因果推理aarXiv cs.LG@Rui Sun 等 3 人原文稍后读已读值得跟进有用关注 TRACE
论文Agent 与开发者精选73°09:28基于策略引导嵌入搜索的层次化排列不变特征变换学习PHER解决了表格数据特征变换的三个关键局限,代码已开源在GitHub,适合做表格数据预测的研究者和工程师。#PHER#特征变换#表格数据#强化学习aarXiv cs.LG@Rui Liu 等 8 人原文稍后读已读值得跟进有用关注 PHER
技巧Agent 与开发者05:32模型与工具协同优化技术Omar分享了模型与工具协同优化的价值,RLMs提供了新扩展方式,效果已被多项研究证实。#RLMs#模型-工具协同优化#强化学习#Harness工程elvis@omarsar0原文稍后读已读值得跟进有用关注 RLMs
论文Agent 与开发者73°23:17微软发布FrogNano小模型编程智能体微软教你用合成任务训练小模型编程智能体,不依赖大模型蒸馏,在普通设备上就能运行。#FrogNano#Microsoft#编程智能体#强化学习elvis@omarsar0原文稍后读已读值得跟进有用关注 FrogNano
技巧Agent 与开发者精选73°16:02谷歌绘制果蝇全脑图谱用于游戏训练谷歌把果蝇全脑图谱拿去训练游戏,Alex Wormuth用16.6万神经元控制《毁灭战士》。#MaleCNS#果蝇大脑#毁灭战士#强化学习IIT之家原文稍后读已读值得跟进有用关注 MaleCNS
论文Agent 与开发者73°11:55PlayTrain:LLM生成可适应JavaScript游戏的高效强化学习框架PlayTrain让LLM直接生成JavaScript游戏,无需大量手动编码,RL训练速度达百万决策/秒/GPU。#PlayTrain#LLM#JavaScript#强化学习aarXiv cs.LG@Ryan Truong 等 4 人原文稍后读已读值得跟进有用关注 PlayTrain
论文Agent 与开发者73°11:41CAST结合规划器引导行为提升强化学习新提出的CAST方法结合规划器与策略,在强化学习中实现更高效的值学习,并在四足机器人上验证效果。#CAST#强化学习#模型基础#规划器aarXiv: Google DeepMind@Pietro Noah Crestaz 等 4 人原文稍后读已读值得跟进有用关注 CAST
论文Agent 与开发者11:20ThinkPrior:零轮次难度先验用于RLVR冷启动提示选择研究人员提出ThinkPrior方法,通过离线锚点构建难度先验,解决了RLVR训练中的冷启动问题,显著减少了无效轮次。#ThinkPrior#RLVR#GRPO#Qwen2.5-Math-7BaarXiv cs.AI@Tommy Sha 等 3 人原文稍后读已读值得跟进有用关注 ThinkPrior
论文Agent 与开发者73°09:47OSOL缓解多领域强化学习中的高阶干扰清华团队提出OSOL方法,通过分析token足迹解决多领域RL性能退化问题,在Qwen3-30B-A3B上提升5.7%性能。#OSOL#Qwen3-30B-A3B#强化学习#多领域aarXiv cs.LG@Zihan Lin 等 7 人原文稍后读已读值得跟进有用关注 OSOL
行业Agent 与开发者精选15:48原小米汽车L3负责人创业攻坚具身大脑小米前L3负责人王乃岩创业,用强化学习+域随机化方法打造具身大脑,和传统具身大脑创业派不同。#王乃岩#具身大脑#L3#强化学习IIT之家原文稍后读已读值得跟进有用关注 王乃岩
论文Agent 与开发者精选73°09:39GUT:量化优化LLM推理不确定性GUT方法通过图复杂度量化LLM推理不确定性,并用强化学习优化,解决了LLM推理过程中的分支发散问题。#LLMs#GUT#推理不确定性#强化学习aarXiv cs.AI@Shuang Liang 等 4 人原文稍后读已读值得跟进有用关注 LLMs
论文Agent 与开发者73°09:36量子机器学习框架统一建模器件清华团队用强化学习发现量子电路,在器件建模上误差降低59-84%,比6个经典方法都好。#量子机器学习#强化学习#PQC#GNNaarXiv cs.AI@Rushat Rai 等 13 人原文稍后读已读值得跟进有用关注 量子机器学习
模型Agent 与开发者12:54世界模型训练后退出,机器人能力提升MIT团队让AI模型训练完就'退场',机器人反而更聪明了,这种反直觉方法值得关注。#世界模型#机器人#MIT#Robotics量子位@梦瑶原文稍后读已读值得跟进有用关注 世界模型
论文中美对照精选73°02:17腾讯发布环境进化论文解决智能体训练难题腾讯这篇论文解决了智能体RL的环境供应瓶颈,提出不依赖智能体弱点就能提升环境难度的方法。#Tencent#环境进化#智能体#强化学习elvis@omarsar0原文稍后读已读值得跟进有用关注 Tencent
模型19:21星尘发布SmoothRL异步强化学习框架星尘智能出了SmoothRL,让机器人不等大模型也能实时决策,比同步推理效率高多了。#星尘智能#SmoothRL#强化学习#基座模型量子位@量子位的朋友们原文稍后读已读值得跟进有用关注 星尘智能
论文精选73°11:19顺序优于联合:RLVR与OPD方法对比研究OpenAI等机构常用方法被挑战,论文证明先OPD后RL的两阶段训练效果更好,还给出了实用切换信号。#RLVR#OPD#大模型推理#强化学习aarXiv cs.LG@Boyan Li 等 6 人原文稍后读已读值得跟进有用关注 RLVR
论文精选73°11:17PreferenceEKF 实现高效主动奖励学习PreferenceEKF 用子空间推理解决奖励模型不确定性问题,比传统贝叶斯方法更高效。#PreferenceEKF#RLHF#强化学习#贝叶斯方法aarXiv cs.LG@Yutai Zhou, Erdem Bıyık原文稍后读已读值得跟进有用关注 PreferenceEKF
论文精选73°12:06Cliff:从首次错误中学习过程奖励研究人员提出Cliff方法,通过识别首次错误来改进强化学习,性能提升显著且适用性广。#Cliff#RLVR#强化学习#推理模型aarXiv cs.LG@Peixuan Han 等 6 人原文稍后读已读值得跟进有用关注 Cliff
模型Agent 与开发者多源确认78°11:51Nemotron-3模型在编程竞赛中超越人类金牌选手NVIDIA训练的编程竞赛模型首次在IOI中击败人类冠军,分数535.4远超金牌线361.12。#Nemotron-3#IOI#编程竞赛#GenCorrect2 个信源在谈事件专题aarXiv cs.LG@Aleksander Ficek 等 5 人3 个信源在谈原文稍后读已读值得跟进有用关注 Nemotron-3
论文精选73°09:12英国气象局模型集成分布式强化学习英国气象局将强化学习集成到全球天气预报模型,显著降低多个纬度带的预报误差。#Met Office#Unified Model#强化学习#天气预报aarXiv cs.LG@Pritthijit Nath 等 5 人原文稍后读已读值得跟进有用关注 Met Office
论文精选09:06多轮智能体信用分配的结构性研究论文发现多轮智能体信用分配中,均匀奖励分配比针对性分配更有效,颠覆了传统认知。#智能体#信用分配#tau^2-bench#ToolACE-2-8BaarXiv cs.LG@Chenyu Zhou 等 4 人原文稍后读已读值得跟进有用关注 智能体
行业15:44孙鹏博士加盟星尘智能字节跳动前强化学习专家孙鹏加入星尘智能,将强化其Physical AI技术实力。#孙鹏#星尘智能#字节跳动#Physical AI量子位@量子位的朋友们原文稍后读已读值得跟进有用关注 孙鹏
论文精选73°10:49语言强化学习新范式兴起这篇论文首次系统梳理了语言强化学习,将现有研究分为三大类,帮助理解语言如何重塑智能体开发。#语言强化学习#语言智能体#VRL#强化学习aarXiv cs.AI@Kshitij Tayal 等 5 人原文稍后读已读值得跟进有用关注 语言强化学习
模型精选73°10:15Facet-0:机器人基础模型实现高精度装配Facet-0 模型通过预测和评估接触后果,让机器人能完成高精度装配,成功率比最强基线高出 5 倍多。#Facet-0#机器人#精密装配#强化学习aarXiv cs.LG@Haoyuan Deng 等 9 人原文稍后读已读值得跟进有用关注 Facet-0
论文73°10:12SAGE框架:从VLM教师学习自主策略SAGE框架让VLM只在关键时刻提供指导,大幅减少调用次数,学习到的策略甚至能超越VLM教师表现。#SAGE#VLM#强化学习#视觉语言模型aarXiv cs.LG@Matteo Merler 等 5 人原文稍后读已读值得跟进有用关注 SAGE
论文精选73°10:11NashDreamer:零和博弈模型强化学习框架斯坦福团队推出NashDreamer,解决零和博弈中的非平稳性问题,比无模型基线训练效率更高。#NashDreamer#强化学习#零和博弈#多智能体aarXiv cs.LG@Tomáš Holeček, Viliam Lisý原文稍后读已读值得跟进有用关注 NashDreamer
论文精选73°09:37ARISE-RL:基于强化学习的智能体自我进化框架OpenAI新框架ARISE-RL用评分协同进化解决开放智能体训练难题,ECR-Bench基准测试验证效果。#ARISE-RL#强化学习#智能体#ECR-BenchaarXiv cs.AI@Fanrui Zhang 等 16 人原文稍后读已读值得跟进有用关注 ARISE-RL
技巧Agent 与开发者05:43用鸭子解释强化学习Remi Fabre用鸭子动画解释强化学习,直观展示Microduck学习过程#强化学习#Microduck#Remi Fabre#机器学习Thomas Wolf@Thom_Wolf原文稍后读已读值得跟进有用关注 强化学习
论文政策与合规精选73°11:23TASPO解决智能体政策优化中的监督-信用差距TASPO解决了智能体政策优化中的监督-信用差距问题,让特权信息只重新分配行动间的信用,不改变整体更新方向。#TASPO#智能体#GRPO#强化学习aarXiv cs.AI@Jingxiao Yang 等 6 人原文稍后读已读值得跟进有用关注 TASPO
论文78°11:22大推理模型超越人类监督的扩展路径这篇论文系统分析了大推理模型如何减少人类依赖,提出了五级发展阶梯和三种评估对象。#LRM#推理模型#强化学习#GitHubaarXiv cs.AI@Zhiqin Yang 等 19 人原文稍后读已读值得跟进有用关注 LRM
论文精选73°11:19大语言模型自我建模评估与改进研究者提出LLM自我建模评估基准,用合成数据提升模型自我认知能力,但不构成真正的内省。#LLM#self-modeling#强化学习#开源模型aarXiv cs.AI@Siqi Zeng 等 3 人原文稍后读已读值得跟进有用关注 LLM
论文精选73°10:49三步序列学习:对比强化学习中的动作块表示这篇论文展示了对比强化学习通过动作块建模获得显著性能提升,揭示了动作块携带更多目标信息的新机制。#对比强化学习#动作块#表示学习#强化学习aarXiv cs.LG@Michal Korniak 等 5 人原文稍后读已读值得跟进有用关注 对比强化学习
论文精选73°10:44PAC:LLM多任务强化学习的新课程方法PAC方法解决了LLM多任务RL中任务分配问题,结合优势信号和实际奖励增益,提升训练效率。#PAC#LLM#强化学习#课程学习aarXiv cs.LG@Yuanqiang Yu 等 11 人原文稍后读已读值得跟进有用关注 PAC
论文10:17GMTS方法提升LLM推理训练效果GMTS方法让LLM推理训练更高效,前20%标记选择比传统熵方法表现更好。#GMTS#RLVR#LLM#推理模型aarXiv cs.AI@Outongyi Lv 等 3 人原文稍后读已读值得跟进有用关注 GMTS
论文精选73°09:15AgenticRag-R1:基于栈内存的智能体强化学习框架清华团队推出 AgenticRag-R1,解决多步推理中的检索适应性问题,比传统方法更聪明。#AgenticRag-R1#RAG#强化学习#多步推理aarXiv cs.AI@Xinke Jiang 等 15 人原文稍后读已读值得跟进有用关注 AgenticRag-R1
产品精选23:49FireworksAI推出强化学习全流程平台FireworksAI推出强化学习全流程平台,实现训练到推理闭环,适合大规模RL项目使用。#FireworksAI#强化学习#RL#AI平台Fireworks AI@FireworksAI_HQ原文稍后读已读值得跟进有用关注 FireworksAI
论文精选73°11:43Aero Hand Open:仿真就绪的肌腱驱动手MIT发布了仿真就绪的肌腱驱动手Aero,包含完整训练包,无需微调即可部署。#Aero Hand Open#肌腱驱动手#强化学习#拟人化手aarXiv cs.LG@Nan Wang 等 8 人原文稍后读已读值得跟进有用关注 Aero Hand Open
行业多源确认精选10:01Hugging Face事件启示:可验证奖励的强化学习OpenAI一年前提出的CoTs安全策略为何在Hugging Face事件中被忽视?#OpenAI#Hugging Face#强化学习#LLM10 个信源在谈事件专题Amjad Masad@amasad11 个信源在谈原文稍后读已读值得跟进有用关注 OpenAI