11:42官方一手arXiv: Google DeepMind@Hoda Yamani, Yuning Xing, Koen van Rijnsoever, Bruce A. MacDonald, Henry Williams研究人员提出即时回合重复(IER)机制,通过立即重复成功回合中的动作序列来提升强化学习样本效率。该机制被集成到SAC和TD3算法中,并在MuJoCo和DeepMind Control Suite等基准测试上进行了验证。实验结果表明,这种简单方法优于标准基线和自我模仿学习基线,在机器人操作任务中也表现出色。AI模型强化学习IERSAC推荐理由:这篇论文提出了一种简单却有效的IER机制,能让强化学习智能体通过重复成功动作更快学习。原文稍后读已读值得跟进有用关注 强化学习
11:29官方账号arXiv cs.LG@Ya-Chia Shen, Woei-Leong Chan论文提出一种物理感知的端到端深度强化学习(DRL)方法,直接对四旋翼的低层体轴输入(总推力与体轴扭矩)进行控制,结合高保真Simulink环境与12状态刚体模型。方法包含基于Moore-Penrose伪逆的Action2RPM分配,以及一阶作动器动力学(时间常数0.076s)和转子陀螺耦合。在四种DRL算法(DDPG、TD3、PPO、SAC)的两阶段任务中,SAC和TD3展现出更优的稳定性和探索效率,PPO样本效率较低。研究强调了建模作动器滞后与气动力矩对稳定低层控制的重要性,并提供了可复现的基准。论文四旋翼控制深度强化学习物理感知推荐理由:这篇论文把物理建模和DRL结合起来控无人机,SAC和TD3比PPO表现好,有具体数字和对比,搞控制或强化学习的可以看看。原文稍后读已读值得跟进有用关注 四旋翼控制
10:21官方账号arXiv cs.LG@Zahra Abdalla Elashaal, Afef Hfaiedh, Nahla Khraief, Issmail Ellabib, Giansalvo Cirrincione论文提出一种两层分层强化学习(HRL)框架,高层负责策略规划,底层采用连续控制算法Soft Actor-Critic(SAC),并通过熵正则化策略优化。该框架在Search-and-Rescue-2(SAR-2)数据集上训练和评估。HRL-SAC在成功率、覆盖效率和收敛速度上均优于普通SAC基线,有效解决延迟奖励和连续控制问题。实验表明分层熵正则化策略是处理长视野稀疏奖励任务的有前景方案。论文Hierarchical Soft Actor-CriticSACSAR-2推荐理由:这篇论文教你用分层SAC解决稀疏奖励的长期任务,比普通SAC成功率更高,代码已开源。原文稍后读已读值得跟进有用关注 Hierarchical Soft Actor-Critic
10:16官方账号arXiv cs.LG@Mohammadreza Kasaei, Klemen Voncina, Hamidreza Kasaei该论文研究机器人在多障碍物环境中安全投掷物体到目标篮筐的问题。现有方法如TossingBot假设无障碍环境,而本工作引入势场状态表示(PFR),以固定网格编码篮筐吸引和障碍排斥,使强化学习策略能泛化到任意障碍数量与配置。在仿真中使用SAC、DDPG、TD3三种算法训练,其中SAC表现最稳定。真实实验中,对未见过的可投掷物体取得了高达90%的成功率,验证了PFR的鲁棒性和实用性。论文SACDDPGTD3推荐理由:这篇论文教机器人怎么在乱堆东西的桌面上把物体扔进篮筐,用势场表示结合SAC算法,真实实验成功率90%,比TossingBot强不少。原文稍后读已读值得跟进有用关注 SAC
11:20官方账号arXiv cs.LG@Jan Stenner, Alexander Kilian, Sebastian Peitz, Hermann de Meer该论文研究了强化学习作为在线控制器,用于风电场内数据中心的高性能计算(HPC)工作负载转移。使用固定日仿真框架结合合成风能和电价信号以及延迟完成反馈进行测试。在单个风轮机和单个数据中心的基准场景中,纯强化学习存在信用分配问题,早期白天未能充分利用免费风能。评估了两种互补措施:基于优化的模仿学习和基于势能的奖励塑造。在200天测试集上,PPO和SAC变体表现出色,但性能仍低于具有全局视野的优化器。论文强化学习数据中心风电场推荐理由:这篇论文用强化学习让风电场数据中心更省电,在单机场景下比较了PPO和SAC的效果,还试了模仿学习和奖励塑造。原文稍后读已读值得跟进有用关注 强化学习
09:34官方一手arXiv: DeepSeek@Ruiyang Ma, Teng Ma, Junru Li, Hantian Zha, Xuchun Shang, Qingda Hu, Zheng Liu, Xinjun Yang, Tao Ma, Guojie Luo精选71°长上下文LLM推理的内存瓶颈日益突出。传统RDMA解耦内存池对于稀疏注意力模型效率低下,仍需完整获取KV缓存。SAC系统利用CXL的低延迟、缓存行粒度加载/存储语义,仅在推理时按需获取所需的top-k KV条目。在DeepSeek-V3.2上使用SGLang的评估显示,相比RDMA基线,SAC实现了2.1倍吞吐量提升、9.7倍TTFT降低和1.8倍TBT降低。论文SACCXLKV缓存3 个信源在谈事件专题推荐理由:长上下文推理,内存传输是瓶颈。新方案SAC用CXL按需取KV缓存,比RDMA吞吐量翻倍、延迟降到十分之一,做稀疏推理的值得一看。原文稍后读已读值得跟进有用关注 SAC