11:38官方账号arXiv cs.LG@Javier Aguilar Martín该研究探讨了Code World Model范式中LLM合成的可执行世界模型在连续控制环境下的认证问题。研究发现GPT-5.x在105个包含模式的样本中修复了被省略的1D夹具,在56个仪器流块中有50次完全准确(95%置信区间[0.781, 0.960])。在2D区域实验中,156个样本中没有任何工件能恢复规则,而8个有针对性的干预措施未能解决失败问题。研究证明了版本空间证书表明识别是类相对的,在最宽剂量下,20个块中有20个 declared fit 成功,20个样本一致圆中有18个在容差范围内。论文Code World ModelGPT-5.x连续控制推荐理由:GPT-5.x修复代码模型缺陷的实验揭示了采样验证的局限性原文稍后读已读值得跟进有用关注 Code World Model
11:47官方账号arXiv cs.LG@Rohit Kumar Salla, Manoj Saravanan, Simon Stepputtis扩散策略在连续控制中性能出色,但迭代去噪带来高计算成本。POGP框架通过Bellman式递归学习每个中间去噪步骤的前缀值函数。POGP的前缀值函数提供辅助训练目标,并在测试时决定是否提前停止。在MuJoCo的4个环境中与12个基线对比,POGP将所需去噪迭代减少约2.7倍,同时保留近全部任务性能。相比最先进的动态扩散基线,前缀训练还使最终任务性能提升约3.5%。AI模型POGPDiffusion PolicyMuJoCo推荐理由:POGP能在保持性能的同时把去噪步数砍掉近三分之二,还比现有动态扩散方法更准,做连续控制的可以看看。原文稍后读已读值得跟进有用关注 POGP
09:57官方一手arXiv: Google DeepMind@Jiaqi Li, Xinglong Zhang, Haibin Xie, Yixing Lan, Wei Pan, Xin Xu精选Koopman Dreamer是一种基于Dreamer架构的世界模型,其确定性潜动力学核心采用二维旋转-缩放块,谱半径有界以表示阻尼与周期模式。模型通过线性与低秩双线性动作项捕捉全局和状态依赖控制效应,结合后验条件EMA教师目标与一致性、多步展开等目标训练。论文推导了多步展开误差界,分离谱骨干和双线性交互的放大效应与随机状态失配的影响。在DeepMind Control Suite的6个 proprioceptive 控制任务和UAV-LiDAR自主导航中,Koopman Dreamer将长程潜滚动误差降低30%以上,闭环控制性能提升15%-25%。论文Koopman DreamerDreamer世界模型推荐理由:Koopman Dreamer 给 Dreamer 加了个谱约束核,长程想象稳多了。在 DeepMind 控制套件和无人机导航上,比原版 Dreamer 控得更好更稳。原文稍后读已读值得跟进有用关注 Koopman Dreamer
10:51官方一手arXiv: Google DeepMind@Junjian Zhang, Hao Tan, Ruonan Li, Dong Zhu, Aiping Li, Zhaoquan GuARB4WM提出一个统一的评估框架,用于测试世界模型在视觉扰动下的对抗鲁棒性。该框架定义了五个白盒损失目标,涵盖策略、价值和潜在动力学三个层面。在MetaWorld和DeepMind Control Suite的20个任务上评估了四种Dreamer-style代理。结果显示,针对值估计、潜在表示和RSSM动力学的攻击与直接策略破坏同等有害,早期或频繁扰动尤其严重。代码已开源并提供使用接口。AI模型ARB4WMDreamer世界模型推荐理由:想检验你的世界模型扛不扛揍?ARB4WM这个新基准专门测视觉扰动下的鲁棒性,比单看动作空间全面多了。原文稍后读已读值得跟进有用关注 ARB4WM
13:09官方账号arXiv cs.AI@Anton Bolychev, Georgiy Malaniya, Sinan Ibrahim, Pavel Osinenko该论文提出了一种新的强化学习训练方法,通过嵌入已有的基线策略来提升训练效率。方法在训练初期依赖基线策略,逐步将控制权转移给可训练的学习策略,最终使学习策略独立运行。理论分析证明了该方法在目标到达概率上的优势,实验表明其在连续控制任务中表现优于或持平于现有方法,且全程保持高目标到达率。论文强化学习策略增强基线策略推荐理由:做强化学习训练的团队可以省下从头调参的功夫——用现有基线策略做跳板,训练效率更高且最终策略更强,值得在连续控制任务上试试。原文稍后读已读值得跟进有用关注 强化学习
11:57官方账号arXiv cs.AI@Boshu Lei, Kostas Daniilidis, Antonio Loquercio精选本文提出 RLDT(Reinforcement Learning with Density Transport),一种在线强化学习算法,用于微调连续控制问题中的流匹配策略。核心思想是将策略改进视为动作密度向高奖励区域的传输,与流匹配模型的传输公式自然对齐。RLDT 使用 Stein 变分梯度下降(SVGD)从最大熵 RL 目标构建传输场,然后微调预训练的流匹配策略以对齐该场。通过预期目标估计近似中间去噪步骤的动作,避免了不稳定的反向传播。实验表明,RLDT 在奖励质量和收敛速度上优于基线,适用于密集/稀疏奖励及基于状态/视觉的长期机器人操作任务。论文强化学习流匹配密度传输推荐理由:RLDT 解决了流匹配策略在强化学习中难以微调的痛点,做连续控制或机器人操作的团队可以直接参考其密度传输思路,比蒸馏或近似分布的方法更高效。原文稍后读已读值得跟进有用关注 强化学习
10:04官方一手arXiv: OpenAI@Shuai Zhen, Yifan Zhang, Yuling Wang, Yanhua Yu强化学习长期面临样本效率低下的问题,利用群不变马尔可夫决策过程(G-invariant MDPs)是一种有前景的缓解方法。现有工作主要关注基于图像的强化学习和旋转对称性(如SO(2)),而基于状态的强化学习和反射对称性尚未充分探索。本文提出Reflex范式,专注于基于状态的连续控制任务,利用反射对称性(包括轴向反射和双侧反射),并与PPO和SAC等算法无缝集成。通过理论分析对称性保持的最优值函数和策略,Reflex引入对称性正则化机制,在OpenAI Gym和DeepMind Control基准测试中显著提升了样本效率和性能。代码已开源。论文强化学习样本效率反射对称性8 个信源在谈事件专题推荐理由:Reflex解决了强化学习样本效率低下的痛点,尤其适合做连续控制任务的RL研究者——直接集成PPO/SAC就能提升性能,值得一试。原文稍后读已读值得跟进有用关注 强化学习
11:41官方一手arXiv: Google DeepMind@Bosun Liang, Shuo Pei, Zirui Chen, Chuanzhi Fan, Chen Sun, Yuankai Wu, Huachun Tan, Yong Wang精选强化学习常产生高频振荡控制信号,影响物理部署的安全与稳定。显式动作分块虽能预测固定轨迹,但会扩大策略输出维度,导致优化困难。本文提出双窗口平滑(DWS)框架,通过隐式动作分块实现平滑连续控制,无需扩展动作空间。DWS包含执行窗口(确保物理平滑)和价值窗口(修正评论家偏差),并引入轻量级时序正则化器。在DeepMind控制套件、工业能源管理及视觉自动驾驶任务中,DWS超越现有方法,实现100%成功率。论文强化学习连续控制动作分块推荐理由:做机器人控制或自动驾驶的团队,DWS解决了强化学习控制信号抖动这个老大难问题,无需增加模型复杂度就能提升安全性和成功率,值得在你们的仿真或实机任务上试试。原文稍后读已读值得跟进有用关注 强化学习
19:11官方一手arXiv: Google DeepMind@Jiamin He, Samuel Neumann, Jincheng Mei, Adam White, Martha White本文探讨了在连续动作强化学习中混合策略相对于单峰策略的优势及其实用性。作者指出,尽管混合策略在理论上更灵活,但标准算法如SAC未能充分利用这一优势,主要原因是缺乏低方差的重新参数化技巧。为此,他们提出了边际化重新参数化(MRP)估计器,证明了其比标准似然比方法方差更低。实验表明,MRP混合策略显著优于似然比方法,在某些任务上甚至达到或超越高斯策略。该研究将MRP混合策略从理论好奇转化为实用工具,为强化学习中的策略设计提供了新思路。论文强化学习混合策略连续控制推荐理由:该论文提出了MRP估计器,解决了混合策略在强化学习中的方差问题,实验验证了其有效性,对从事连续控制任务的研究者和工程师具有参考价值。原文稍后读已读值得跟进有用关注 强化学习