5月25日
5月22日
5月21日
16:11
16:11Fireworks AI@FireworksAI_HQ
76°
Cursor 团队没有通过提示工程优化 Composer 2.5,而是直接训练了模型。他们与 Fireworks 合作,在 Fireworks 上运行大规模强化学习(RL)滚动,同时进行生产推理。Fireworks 强调,到 2027 年,训练自己的模型是维持竞争护城河的唯一方式。这一做法展示了从提示工程到模型训练的转变趋势。
事件专题

推荐理由:Cursor 用 RL 训练模型而非提示工程,给 AI 产品团队一个关键信号:2027 年后,训练自己的模型才是护城河。做 AI 应用开发的建议点开,看看他们怎么和 Fireworks 合作跑 RL 滚动。
12:27
12:27官方账号arXiv cs.LG@Elle Miller, Jayaram Reddy, Ayush Deshmukh, Trevor McInroe, David Abel, Oisin Mac Aodha, Sethu Vijayakumar
精选72°
机器人触觉强化学习(RL)研究因碎片化和过度关注饱和的定向任务而受阻。roto 2.0 是一个 GPU 并行化的基准测试,覆盖四种不同机器人形态(16-24 自由度),专注于仅依赖本体感觉和触觉的“盲”操作,无需状态信息或知识蒸馏。其盲代理在 10 秒内完成 13 次 Baoding 球旋转,速度比当前最先进水平快一个数量级。通过开源环境和调优基线,该工作降低了入门门槛,让研究者能聚焦核心算法挑战。
推荐理由:触觉 RL 终于有了标准化的 GPU 并行基准,做机器人操作和强化学习的团队可以直接用 roto 2.0 测试算法,不用再花时间调环境——盲操速度提升 10 倍的结果值得点开看看。
11:13
11:13官方账号arXiv cs.AI@Harsh Parikh, Gabriel Levin-Konigsberg, Dominique Perrault-Joncas, Alexander Volfovsky
精选
这篇论文研究了在模拟器与真实实验之间如何权衡的问题。模拟器成本低但存在校准偏差,真实实验无偏但成本高。作者提出了一个扩展的模拟引理,将模拟器的价值误差分解为可识别的校准-部署偏移和不可减少的参数残差。他们还分析了模拟器最优策略与真实最优策略之间的价值差距,分为局部和可达性两部分。最后,提出了Fisher-SEP算法,通过最小化目标策略价值的后验预测方差来指导实验设计,并在自动售货机供应链和HIV移动测试两个案例中验证了其有效性。
推荐理由:这篇论文为做强化学习或机器人部署的团队提供了一个严谨的框架,帮你判断什么时候该相信模拟器、什么时候该做真实实验。做仿真到真实迁移的开发者可以直接参考其Fisher-SEP算法来优化实验预算。
11:09
11:09官方账号arXiv cs.AI@Xiaoqiang Wang, Chao Wang, Hadi Nekoei, Christopher Pal, Alexandre Lacoste, Spandana Gella, Bang Liu, Perouz Taslakian
精选
Mem-π 是一种新型自适应记忆框架,它让大语言模型智能体在需要时动态生成指导,而不是从外部存储中检索静态条目。该框架使用独立的语言或视觉语言模型,基于当前上下文决定是否生成以及生成什么指导,并通过决策-内容解耦的强化学习目标进行训练。在网页导航、终端工具使用和文本交互等基准测试中,Mem-π 相比检索式记忆和之前强化学习优化的基线方法表现更优,在网页导航任务上实现了超过30%的相对提升。
推荐理由:做AI智能体开发的团队终于有了解决记忆错配问题的方案——Mem-π 让智能体学会“按需生成”而非“死板检索”,在复杂任务中效果显著,建议研究记忆增强的开发者点开看看。
5月20日
11:41
11:41官方一手arXiv: Google DeepMind@Bosun Liang, Shuo Pei, Zirui Chen, Chuanzhi Fan, Chen Sun, Yuankai Wu, Huachun Tan, Yong Wang
精选
强化学习常产生高频振荡控制信号,影响物理部署的安全与稳定。显式动作分块虽能预测固定轨迹,但会扩大策略输出维度,导致优化困难。本文提出双窗口平滑(DWS)框架,通过隐式动作分块实现平滑连续控制,无需扩展动作空间。DWS包含执行窗口(确保物理平滑)和价值窗口(修正评论家偏差),并引入轻量级时序正则化器。在DeepMind控制套件、工业能源管理及视觉自动驾驶任务中,DWS超越现有方法,实现100%成功率。
推荐理由:做机器人控制或自动驾驶的团队,DWS解决了强化学习控制信号抖动这个老大难问题,无需增加模型复杂度就能提升安全性和成功率,值得在你们的仿真或实机任务上试试。
5月19日
14:36
14:36官方账号arXiv cs.AI@Qisai Liu, Zhanhong Jiang, Joshua Russell Waite, Aditya Balu, Cody Fleming, Soumik Sarkar
精选
COOPO 是一种新型强化学习框架,通过循环交替进行约束离线训练和在线微调,解决了离线强化学习中的分布偏移和在线学习中的高交互成本问题。该算法在每个循环中先用 KL 正则化的优势加权更新锚定策略,再用任意策略优化进行在线微调,定期回归离线训练可消除遗忘和漂移。理论证明 COOPO 在标准覆盖假设下能实现单调改进,在线样本效率优于纯在线 RL。在 D4RL 基准测试中,COOPO 相比最先进的混合方法减少了在线交互次数,同时提升了最终回报,且对不同离线算法和在线优化器具有鲁棒性。
推荐理由:做强化学习研究的团队终于有了一个能同时解决分布偏移和灾难性遗忘的通用框架——COOPO 的循环设计让离线数据复用和在线探索形成正向循环,D4RL 上效果显著,建议做 RL 算法开发的同学点开看理论证明和实验细节。
14:19
14:19Sualeh Asif@sualehasif996
72°
Cursor 团队宣布推出 Composer 2.5,这是其最强大的模型版本。该模型在强化学习(RL)方面取得显著进步,智能水平更高,能更好地处理长时间运行的任务,并更可靠地遵循复杂指令。为庆祝发布,未来一周内用户可享受双倍模型使用额度。团队正与 SpaceXAI 合作,计划在下一版本中进一步扩展模型规模和计算量。
事件专题

推荐理由:Cursor 用户将直接受益于更强的代码生成和任务执行能力,尤其是处理复杂、长期项目时体验提升明显。建议立即体验双倍额度,感受 RL 优化带来的实际效果。
5月18日
12:00
12:00官方账号arXiv cs.AI@Zhen Zhang, Liangcai Su, Zhuo Chen, Xiang Lin, Haotian Xu, Simon Shaolei Du, Kaiyu Yang, Bo An, Lidong Bing, Xinyu Wang
精选76°
Argus 提出了一种新的深度研究方法,通过 Searcher 和 Navigator 两个智能体协作,将研究任务视为拼图组装而非暴力并行搜索。Navigator 维护共享证据图,验证缺失信息并调度 Searcher 收集,最终生成带来源追踪的答案。在 35B-A3B MoE 模型上,单 Searcher 提升 5.5 分,8 个并行 Searcher 提升 12.7 分,64 个 Searcher 在 BrowseComp 上达到 86.2,超越所有专有智能体,且 Navigator 推理上下文保持在 21.5K tokens 以内。该方法解决了并行搜索中证据重复和上下文超限的问题。
推荐理由:做深度研究智能体或搜索系统的团队,终于有了解决并行搜索证据重复和上下文瓶颈的方案——Argus 用拼图式组装替代暴力搜索,效率提升明显,值得在复杂信息检索任务中尝试。
10:39
10:39官方账号arXiv cs.LG@Vaidehi Bagaria, Nikshep Grampurohit, Pulkit Verma
精选
该论文发现GRPO算法在VLA策略强化学习中,梯度计算占78%时间,而大部分计算浪费在策略已掌握的阶段。为此提出概率性分块掩码(PCM),通过成功-失败动作方差识别关键阶段,仅对少量分块进行梯度更新。PCM无需额外奖励模型,在LIBERO基准上保持相同成功率的同时,实现2.38倍加速、4.8倍梯度更新加速和60%峰值内存降低。
推荐理由:做VLA机器人强化学习的团队终于有了省算力的方案——PCM直接替换GRPO就能省60%内存、快2倍多,效果还不打折,建议做后训练优化的点开看看。