10:39官方一手arXiv: OpenAI@Prishita Ray该论文提出一种基于单向梯度优化的重参数化课程生成框架,用于在连续环境参数(如转弯率、障碍物、摩擦、坑洞、坡度)中自动设计训练课程,提升自主智能体的导航策略泛化能力。方法在包含图像和标量的多模态观测空间中引入分布偏移正则化目标,以学习更细粒度的潜在表征。在OpenAI Gym的Car Racing和Bipedal Walker两个连续控制环境中,该方法在五个随机种子上优于普通策略训练、随机参数采样、手动课程、前沿方法、SPRL、ALP-GMM和反向课程学习等基线。消融实验验证了重参数化课程机制的有效性,并揭示了辅助正则化目标在不同环境中的依赖效果。论文课程生成导航策略OpenAI Gym9 个信源在谈事件专题推荐理由:想让导航策略适应各种环境参数?这篇论文的自动课程生成方法在Car Racing和Bipedal Walker上打败了SPRL等基线,值得一看。原文稍后读已读值得跟进有用关注 课程生成
09:13官方账号arXiv cs.LG@Enrico M. Malatesta, Alessandra Passalacqua, Riccardo Zecchina论文将零温度下的重叠间隙性质(OGP)扩展到有限温度,允许训练误差存在并统计惩罚。首先证明零温度平衡测度中占主导的冻结核1步复制对称破缺解在任意有限温度下依然存活。然后基于决策边界附近单模式吉布斯权重的平滑性,导出准则判断有限温度松弛何时消除冻结。进一步将OGP推广到有限温度,显示算法可访问的稠密有限能量区域在OGP临界密度α_OGP之上存在,直到随训练误差ε增长的阈值α_OGP(ε)。在师生设置中,这些宽有限能量区域仍保持良好泛化,且有限能量消息传递算法表明热噪声能在恢复教师和零温度解均困难的密度区域实现有效泛化。论文OGP非凸神经网络有限温度推荐理由:这篇论文把神经网络解空间的OGP理论从零温度推广到了有限温度,发现允许一点训练误差就能让算法在原来计算困难的区域找到好解,而且泛化也不差。原文稍后读已读值得跟进有用关注 OGP
01:10elvis@omarsar0精选研究提出RLM harness作为组合泛化器,使Transformer无需额外泛化能力即可迁移任务。训练RLM时,短任务(如8倍长度)与长任务产生相同轨迹,模型可泛化至8-32倍长度未见任务。跨领域任务(如数学解法与论文写作)共享分解策略时也表现出相同泛化效果。该发现基于2026年论文,通过设计良好的harness形成商集,使LLM调用将结构相似任务视为相同。论文RLMHarnessTransformer推荐理由:这篇研究很酷,RLM harness让Transformer在短任务上训练就能自动泛化到长任务,甚至跨领域。不用改模型结构,靠框架就能实现。原文稍后读已读值得跟进有用关注 RLM
12:02官方账号arXiv cs.AI@Aastha Sharma, Guangjing WangVoxENES 2026是一个双语(英语和西班牙语)基准,包含53,628个音频样本,使用10种现代语音合成方法生成,在10种标准化后处理条件下评估。8个预训练检测器未经微调测试,最佳模型总体EER为28.98%,大多数接近或低于随机水平。结果凸显当前检测器依赖脆弱伪影,难以泛化到LLM驱动的TTS和语音转换。论文VoxENES 2026语音欺骗检测TTS推荐理由:新基准VoxENES 2026用5万多样本和10种现代语音合成方法,测了8个检测器,最佳EER才28.98%,说明现有检测器对LLM语音基本失效,做语音安全的朋友可以看看。原文稍后读已读值得跟进有用关注 VoxENES 2026
09:37官方账号arXiv cs.AI@Ali Larian, Qian Lin, Chang Zong Wu, Daniel S. Brown该论文研究如何在多环境下学习鲁棒的奖励函数,避免逆强化学习(IRL)因单环境演示而过拟合。作者分析了不同反馈模态(如比较、演示)对奖励约束的强度,发现比较模态在无限数据下提供更强的全局约束。提出一种分层机器教学算法,先贪婪选择互补环境,再在最优环境下查询低成本反馈。在实验中,该方法在相同反馈预算下相比均匀基线显著降低了后悔值(regret),并提升了到未见过环境的泛化能力。论文逆强化学习IRL机器教学推荐理由:想解决机器人奖励函数跨环境失效的问题?这篇论文给出了数学分析和一种更聪明的教学策略,用更少反馈让奖励更鲁棒。原文稍后读已读值得跟进有用关注 逆强化学习
09:57官方账号arXiv cs.LG@Eitan Levin, Venkat Chandrasekaran该论文提出使用随机采样映射(如替换采样、随机分箱、物种采样)来比较不同大小的输入(如点云点数量不同、序列token长度不同、图节点数不同)。通过分析领域内问题实例的对称性,确定了每种采样类型的适用场景。框架给出了函数类连续性的显式泛化率和草图化率,涵盖序列、图和张量上的函数族。具体例子包括矩多项式、同态密度、置换不变Transformer和图神经网络。论文采样泛化图神经网络推荐理由:这篇论文提出了一个统一的采样框架,帮你理解模型在不同大小输入上的泛化能力,还能把大输入压缩成小输入来节省计算,例子涵盖Transformer和图神经网络。原文稍后读已读值得跟进有用关注 采样
10:08官方账号arXiv cs.LG@Jian Xu, Delu Zeng, John Paisley, Qibin Zhao精选该论文通过PAC-Bayesian框架分析了参数化量子电路(PQC)作为策略和价值函数时的泛化机制。研究发现,泛化由Fisher几何有效维度主导,而非参数数量,且纠缠会增大该维度,成为独立的复杂性轴。在固定参数数量的实验中,Fisher有效维度更大的电路显示出更大的训练-测试差距,纠缠电路比非纠缠电路泛化更差。分类、上下文强盗和值函数实验中,效果显著,且在IBM Heron量子处理器上真实噪声下依然成立。论文PAC-BayesianFisher有效维度量子策略推荐理由:别只看参数数量,量子电路里的纠缠才是泛化关键。这篇论文用PAC-Bayesian理论加实验验证,帮你理解怎么设计泛化更好的量子策略。原文稍后读已读值得跟进有用关注 PAC-Bayesian
10:01官方账号arXiv cs.LG@Yao Fu, Chunxia Zhang, Junmin Liu, Yihang Jin, Haishan Ye, Yuanao YangEISAM(Extragradient-Inspired Sharpness-Aware Minimization)是一种新型优化器,通过两步更新过程(预测步骤探索损失景观几何、扰动步骤用基础优化器细化更新)来提升泛化性能。在基准数据集上的实验表明,EISAM在测试准确率和训练效率上持续优于SGD、Adam和SAM。理论分析显示EISAM通过引导参数向曲率更小的平坦极小值收紧泛化界。此外,EISAM降低了对扰动半径的敏感性,简化了超参数调优。论文EISAMSAM优化器推荐理由:这篇论文提出的EISAM优化器比SAM更鲁棒,调参更简单,在多个架构上准确率更高,适合追求更好泛化性能的深度学习实践者。原文稍后读已读值得跟进有用关注 EISAM
09:23官方账号arXiv cs.LG@Max Weltevrede, Matthijs T. J. Spaan, Wendelin Böhmer论文证明在上下文MDP中,过度悲观不会阻碍最优泛化,但必须尊重最优解的对称性。通过理论分析,适度悲观但非对称的值函数可能比过度悲观且对称的值函数泛化更差。数据增强应通过在策略提取时施加一致性损失来提升泛化,而非在增强数据集上常规训练。使用IQL和CQL在旋转对称reacher环境中验证了该方法。论文离线强化学习泛化数据增强推荐理由:这篇论文用理论和实验告诉你,离线RL里悲观多少不重要,悲观的结构对不对才关键,还给出了数据增强的正确用法。原文稍后读已读值得跟进有用关注 离线强化学习
10:10官方一手arXiv: Google DeepMind@Jinwen Wang, Youfang Lin, Xiaobo Hu, Qian Xu, Shuo Wang, Zhuo Chen, Kai LvT2RD提出通过自监督方式将观测分解为任务相关和任务无关表示,包含三个组件:任务相关表示一致性、交叉重建和交叉动态预测。前两个组件实现内容与风格特征解耦,第三个组件引入动态预测以进一步提取任务相关特征。在DeepMind Control Suite和Robotic Manipulation任务上,T2RD实现了SOTA的泛化性能和样本效率。论文T2RD视觉强化学习泛化推荐理由:这篇论文教你用自监督方法解耦视觉特征,T2RD在泛化能力上比现有方法强出一截,做机器人和控制任务的值得看看。原文稍后读已读值得跟进有用关注 T2RD
10:32官方账号arXiv cs.AI@Srijan Tiwari, Aditya Chauhan, Manjot Singh该论文对神经网络在算法任务上的延迟泛化(grokking)现象进行几何分析,发现交叉熵优化下隐藏表示的径向膨胀是延迟的主因。作者提出径向-角分解并推导三个可检验命题,引入单一超参数范数惩罚将激活约束在 sqrt(d) 半径超球面上。在模算术任务上,该惩罚使 MLPs 和 Transformers 的 grokking 加速高达 6 倍;对 10M 参数的 nanoGPT 在 3 位数加法上训练步数减半。论文Grokking泛化几何分析推荐理由:这篇论文用几何视角解释了神经网络为什么先死记硬背后突然泛化,还找到了一个简单技巧(约束隐藏层半径)让 grokking 快 6 倍,值得搞训练的人看看。原文稍后读已读值得跟进有用关注 Grokking
12:12官方账号arXiv cs.LG@Srinivasa Rao P., Vangmayi P Reddy该论文提出统一框架,连接信息论、拓扑和统计力学,解释深度学习的泛化极限。核心是熵可学习性界限(ELH),规定网络仅当数据流形香农熵超过决策边界拓扑熵且平衡网络权重的冯·诺依曼熵时才能学习。作者证明香农-拓扑瓶颈定理,表明超过此界限时系统进入信息挫折的玻璃态记忆阶段,泛化变得热力学不可能。他们发现grokking现象实质是熵释放,权重突然重组解锁瓶颈。论文还提出熵梯度下降(EGD)算法,动态管理权重熵以保持学习轨道。论文深度学习理论信息论泛化推荐理由:这篇论文用熵来解释深度学习泛化的硬极限和grokking,还给了EGD优化算法,理论研究者可以看看。原文稍后读已读值得跟进有用关注 深度学习理论
10:41官方账号arXiv cs.LG@Tianyi Men, Zhuoran Jin, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao该论文提出PEEU方法,通过自主环境探索发现经验并利用事后经验生成严格对齐的高层训练数据。7B模型在真实基准上达到30.6%准确率,超越Qwen2.5-VL-32B。作者提出TDHAF框架分析任务分解的组成性泛化,发现低层原子技能掌握不保证高层规划能力,而高层任务训练对OOD泛化更关键。论文GUI智能体任务规划PEEU推荐理由:这篇让7B小模型在GUI任务规划上超过32B大模型,还分析了不同层级任务泛化的差异,很实用。原文稍后读已读值得跟进有用关注 GUI智能体
11:07官方账号arXiv cs.LG@Ardianto Wibowo, Paulo E Santos, Amer Baghdadi, Matthew Stephenson, Karl Sammut, Jean-Philippe Diguet该论文提出一种基于因果起源的统一分类法,用于描述强化学习(RL)中的分布偏移。作者将监督学习中的经典数据集偏移原则迁移到RL,通过部分可观测马尔可夫决策过程(POMDP)将交互分解为状态分布、观测过程、策略、奖励和转移动力学等结构组件。分类法区分了内部(智能体驱动)和外部(环境驱动)两种分布偏移,并从偏移时间边界角度定义了显式、隐式和混合偏移。该方法统一了分布内/分布外(ID/OOD)泛化与非平稳性,并引入性能退化与恢复指标来评估偏移影响和适应性。论文强化学习分布偏移POMDP推荐理由:这篇论文把RL里训练和测试环境不一致的问题,用因果原因做了系统分类,还统一了OOD泛化和非平稳性的视角,搞清楚偏移根源才能更好做鲁棒性分析。原文稍后读已读值得跟进有用关注 强化学习
10:06官方账号arXiv cs.LG@Minghui Yang, Ling Guo, Liu Yang神经算子模型在函数空间映射上表现良好,但泛化到其他算子时通常需要微调或重新训练。In-Context Operator Networks (ICON) 通过数值上下文提示让模型学习特定算子,无需微调即可适应不同算子,但在分布外任务上仍可能失败。受大语言模型链式提示的启发,研究者提出 Chain of Operators (CHOP) 框架,通过构建由显式初等变换和冻结的 ICON 组成的算子链,在不更新参数的情况下提升 ICON 在分布外任务上的泛化能力。在标量守恒律和平均场控制问题上的实验表明,CHOP 相比直接 ICON 评估降低了相对推理误差,且链中每个算子保持可解释和封闭形式。在一个 PDE 族上构建的链还能泛化到不同族,表明跨系统存在共享机制。论文神经算子ICONChain of Operators推荐理由:CHOP 解决了神经算子模型在分布外任务上泛化差的痛点,做科学计算或 PDE 求解的团队可以直接用这个框架提升模型效果,无需重新训练。原文稍后读已读值得跟进有用关注 神经算子
09:33官方账号arXiv cs.LG@Artur Kuramshin, Özgür Aslan, Cyrus Neary, Glen Berseth精选机器人学习中的大规模策略在操作任务上表现优异,但指令跟随能力不足,主要原因是现有数据集缺乏语言和动作序列多样性。TREAD提出一种可扩展框架,利用大型视觉语言模型(VLM)对现有机器人数据集进行重标注,无需额外数据采集。该方法通过三个步骤:从原始指令生成语义子任务、基于子任务分割演示视频、生成包含物体属性的多样化指令,将长演示分解为语言-动作对。实验表明,在LIBERO基准上,使用TREAD增强数据训练的策略在未见任务和目标上表现更好,提升了规划泛化和语言条件策略泛化能力。论文机器人学习数据增强VLM推荐理由:做机器人数据增强和指令跟随的团队,TREAD用VLM低成本提升数据集质量,直接增强策略泛化,值得在LIBERO等基准上试试。原文稍后读已读值得跟进有用关注 机器人学习
09:47官方账号arXiv cs.AI@Yuan Zhang, Shiqi Zhang, Yedong Shen, Shuai Dong, Jiajun Deng, Xin Zhang, Yuxuan Gao, Jiajia Wu, Xin Nie, Zhiyuan Cheng, Jianmin Ji, Yanyong Zhang, Xingyi Zhang, Jia Pan精选72°GEAR-VLA 是一种新型视觉-语言-动作(VLA)框架,旨在解决现有 VLA 模型在真实部署中面对未见物体、背景变化和不同机器人本体时的泛化问题。它通过粗到细的动作学习、语义对齐的 3D 特征融合以及本体规范化,学习统一的几何感知动作表征。在 LIBERO、零样本 LIBERO-Plus 和 RoboTwin 2.0 上达到最先进性能,在 AgileX 上成功率 85.9%,在未见本体 LDT-01 上达 81.0%,在 212 个未见物体的通用抓取基准上达 90.1%。代码和模型将开源。论文机器人操作VLA模型泛化推荐理由:GEAR-VLA 解决了机器人操作中跨本体、跨场景泛化的核心痛点,做机器人操作研究的团队可以直接参考其粗到细动作学习与 3D 对齐方法,值得关注其开源代码。原文稍后读已读值得跟进有用关注 机器人操作
11:16官方账号arXiv cs.LG@Eduardo Sebastián, Adrian Pfisterer, Vito Mengers, Oliver Brock, Amanda Prorok这篇论文提出了一种新的机器人学习框架,通过将策略分解为“世界因子”和“任务因子”来实现结构泛化。世界因子描述机器人和环境的固有属性,独立于任务意图;任务因子则定义任务逻辑。作者利用贝叶斯模型证据形式化了这种不对称性,并实例化为AICON图与学习策略的组合,梯度作为两个因子的接口。实验表明,该方法在异构机器人、环境和任务中优于端到端基线,能零样本泛化到分布外配置,并直接迁移到真实硬件。论文机器人学习泛化世界模型推荐理由:机器人学习领域长期面临泛化难题,这篇论文从结构分解入手给出了新解法。做机器人策略研究或部署的团队值得关注,零样本迁移到真实硬件意味着可以直接减少重复训练成本。原文稍后读已读值得跟进有用关注 机器人学习
10:25官方账号arXiv cs.LG@Arnas Uselis, Darina Koishigarina, Seong Joon Oh精选人类能轻松将颜色与形状绑定(如“红色圆形”),但 CLIP 等视觉-语言嵌入模型在多物体场景中无法正确绑定概念,表现为“词袋”行为。研究发现,CLIP 的场景嵌入可加性分解为物体表征,但绑定函数复杂度高,导致图像与文本编码器无法学习共享的绑定机制,难以泛化到未见过的概念组合。通过从头训练的受控 Transformer 模型,作者发现当数据覆盖足够时,模型能学会低复杂度的绑定函数(涉及概念间的乘法交互),实现系统性泛化。该工作揭示了嵌入模型在概念绑定上的根本限制与突破条件,代码已开源。论文嵌入模型概念绑定CLIP推荐理由:做多模态嵌入或视觉-语言模型研究的开发者,这篇论文点出了 CLIP 类模型在概念绑定上的核心瓶颈,并给出了可复现的解决方案,值得深入阅读。原文稍后读已读值得跟进有用关注 嵌入模型
10:23官方账号arXiv cs.LG@Zhikun Xu, Yu Feng, Jacob Dineen, Taiwei Shi, Jieyu Zhao, Ben ZhouReuseRL 是一种基于最小描述长度(MDL)原则的强化学习方法,旨在解决大语言模型智能体在强化学习中学习到脆弱、任务特定捷径的问题。该方法从成功轨迹中提取可复用的抽象技能字典,并通过分割成本惩罚编码效率低下的行为,从而鼓励智能体学习更通用、可压缩的行为模式。论文证明了该压缩惩罚的 PAC-Bayes 泛化界,并在 ALFWorld、TextWorld-Cooking 和 Countdown-Stepwise 等基准上,ReuseRL 在分布内和分布外任务上均优于 vanilla GRPO 和强基线方法。这项工作为提升智能体泛化能力提供了新思路,尤其适合需要跨任务迁移的 RL 场景。论文强化学习智能体技能复用推荐理由:ReuseRL 用 MDL 原则解决了智能体 RL 泛化差的痛点,做多任务智能体训练的团队可以直接参考其技能复用机制,提升模型在未见任务上的表现。原文稍后读已读值得跟进有用关注 强化学习
11:37官方账号arXiv cs.AI@Jiayi Zhang, Fanqi Kong, Guibin Zhang, Maojia Song, Zhaoyang Yu, Jianhao Ruan, Jinyu Xiang, Bang Liu, Chenglin Wu, Yuyu Luo精选这篇立场论文提出,通用智能体需要环境缩放(environment scaling)来适应训练分布之外的多样任务和未见环境。当前缩放实践主要关注在固定交互规则下收集更多经验或任务,导致智能体在底层接口、动态、观测或反馈信号变化时表现脆弱。作者将轨迹缩放、任务缩放和环境缩放区分开来,并提出了统一分类法。论文对比了程序化生成器(可控、可验证)和生成式世界模型(覆盖广、开放)两种构建可扩展环境的范式。最后,论文认为可扩展环境是实现鲁棒通用智能体的关键基础。论文通用智能体环境缩放分布偏移推荐理由:做通用智能体研究的团队会发现,当前缩放策略的盲点被戳中了——环境规则集的分布偏移才是泛化瓶颈,值得重新审视自己的实验设计。原文稍后读已读值得跟进有用关注 通用智能体
22:16AK@_akhaliqSkill1 提出了一种通过强化学习统一演化技能增强智能体的方法,旨在提升智能体在复杂任务中的泛化能力和学习效率。该方法将技能学习与强化学习框架结合,使智能体能够自主发现、优化和复用技能模块,从而适应多种任务场景。实验表明,Skill1 在多个基准测试中优于传统方法,尤其在长期规划和策略迁移方面表现突出。这项工作为构建更通用、更自主的智能体系统提供了新思路。论文智能体强化学习技能学习推荐理由:这项研究为技能增强型智能体的设计与训练提供了统一的强化学习框架,路径清晰且实证有效,对推动智能体从单任务到多任务泛化具有实际参考价值。原文稍后读已读值得跟进有用关注 智能体