8月24日
10:59
10:59官方账号arXiv cs.AI@Haonan Jia, Shichao Dong, Zenghui Sun, Jiawen Zheng, Ziqi Miao, Gege Shi, Qiuyu Zhao, Jinsong Lan, Xiaoyong Zhu, Bo Zheng
本文提出Re$^3$Cap,一种基于检索引导的图像描述优化策略,通过强化学习提升图像描述准确性。该方法通过识别图像描述中的幻觉和遗漏,实现更精确的描述。在COCO-LN500基准测试中,Re$^3$Cap相较于GRPO平均提升了8.64%的相关推理性能。
推荐理由:Re$^3$Cap模型通过检索引导优化图像描述,比GRPO提升了8.64%的推理性能,值得一看。
8月23日
8月22日
00:06
8月20日
10:19
10:19官方账号arXiv cs.LG@Tomasz R. Bielecki, Thibaut Mastrolia, Haoze Yan
该研究针对带记忆的Hawkes驱动随机微分方程,提出连续时间强化学习算法Hawkes-CT DDPG;采用有限维马尔可夫化近似方法,将问题转化为可处理的Markovian形式;对比简单指数、Erlang、幂律三类核的离散方法,验证新方法的性能优势。
推荐理由:这研究发布了针对Hawkes过程的连续时间强化学习新方法,用近似技术优化求解,和传统离散方法比效果不同,值得了解。
10:16
10:16官方账号arXiv cs.AI@Boqiao Zhang, Godbless James, Sai Krishna Gottipati, Andrew Fitzgibbon
PGFS++是一种用于分子性质优化的强化学习框架,在合成和多样性约束下实现改进。该框架基于PGFS升级,采用可训练反应模板表示,显著提升性能。相比前代方法,它在改善目标性质的同时保持了输出多样性。
推荐理由:PGFS++是新分子优化方法,能解决合成和多样性难题,比之前版本效果更好还保分子多样性。
8月19日
11:42
11:42官方一手arXiv: Google DeepMind@Hoda Yamani, Yuning Xing, Koen van Rijnsoever, Bruce A. MacDonald, Henry Williams
研究人员提出即时回合重复(IER)机制,通过立即重复成功回合中的动作序列来提升强化学习样本效率。该机制被集成到SAC和TD3算法中,并在MuJoCo和DeepMind Control Suite等基准测试上进行了验证。实验结果表明,这种简单方法优于标准基线和自我模仿学习基线,在机器人操作任务中也表现出色。
推荐理由:这篇论文提出了一种简单却有效的IER机制,能让强化学习智能体通过重复成功动作更快学习。
05:50
05:50官方账号Greg Brockman@gdb
Anthropic联合创始人Dario Amodei在X上表示,公司暂时放缓了前沿训练的扩展,包括最大规模的强化学习计划,以加强安全与监控。他认为安全信心将日益决定AI发展速度。该声明引发广泛关注,获得1353次点赞和约14.6万次浏览。
事件专题

推荐理由:Anthropic主动踩刹车,暂停最大规模强化学习训练来加固安全,想了解前沿AI公司怎么平衡速度和风险可以看看。
8月18日
15:25
15:25官方账号arXiv cs.AI@Langzhe Gu, Chengkai Hou, Meng Li, Xinhua Wang, Jiaming Liu, Xinyuan Lv, Bowei Zhang, Shuanghao Bai, Guangrun Li, Jingyang He, Gaole Dai, Ziluo Ding, Zhiyuan Xu, Kuan Cheng, Jian Tang, Zhengping Che, Shanghang Zhang
HAF框架包含HAF-VLA和HAF-Steer两部分,将预训练的流匹配VLA模型适配到人形机器人全身操作。HAF-VLA通过三阶段动作去噪和跨阶段KV缓存,协调行走、腰姿和双臂操作。HAF-Steer利用流匹配可逆性和DCT降维,在紧凑噪声子空间训练SAC策略,避免更新大型VLA骨干。在7个真实世界人形操作任务中,HAF优于单阶段VLA基线,提升全身协调性和任务性能。
推荐理由:人形机器人全身操作一直难搞,HAF把通用VLA拆成三阶段动作流,再用DCT降维做在线强化学习,7个真实任务都跑赢了基线。
10:16
10:16官方账号arXiv cs.LG@Siddarth Venkatraman, Matthieu Dinot, Laurence Aitchison
论文提出两种互补策略改进价值函数强化学习:特权价值函数(PVF)在不偏置策略目标的前提下注入额外token级信号;TETHER则根据价值函数准确性自适应地在组相对基线和价值基线之间插值。在多个推理任务上,这两种策略均稳定优于标准价值函数基线,并与平均基线GRPO相比具有竞争力或更优。
推荐理由:这论文提了两个新招PVF和TETHER,给LLM强化学习用的,比标准价值函数强,和GRPO差不多甚至更好,搞RL的可以看看。
09:14
09:14官方一手marktechpost@Asif Razzaq
ByteDance Seed与清华AIR发布CUDA Agent,一个用于CUDA内核生成的智能体强化学习系统。该系统训练大语言模型写出比编译器更快的GPU内核。现有前沿模型已能生成正确CUDA,但性能不佳。在KernelBench基准中,基础模型Seed1.6通过率为74.0%。
事件专题

推荐理由:字节和清华出的新系统,用强化学习让模型自己写CUDA,KernelBench上Seed1.6有74%通过率,能超编译器。
8月14日
11:08
11:08官方账号arXiv cs.LG@Lei Bai, Jiaqi Cao, Chiyu Chen, Guanzhou Chen, Kai Chen, Guangran Cheng, Erfei Cui, Xuanlang Dai, Shengyuan Ding, Shangheng Du, Yanhui Duan, Yue Fan, Youqing Fang, Quan Gan, Yuanyuan Gao, Jiaye Ge, Lixin Gu, Yuzhe Gu, Qipeng Guo, Junjun He, Xin Hong, Ming Hu, Zhouqi Hua, Haian Huang, Junhao Huang, Zixian Huang, Minxi Jin, Lingkai Kong, Alexander Lam, Zehao Li, Zonglin Li, Tianhao Liang, Dahua Lin, Junyao Lin, Tianyang Lin, Zhouhan Lin, Jiangning Liu, Jin Liu, Kuikun Liu, Wenran Liu, Yifei Liu, Yuhong Liu, Yuhong Liu, Zhoumianze Liu, Ziyan Liu, Ziyu Liu, Haijun Lv, Han Lv, Chengqi Lyu, Le Ma, Ningsheng Ma, Zerun Ma, Haoyang Peng, Runyu Peng, Jifei Shan, Zixin Shang, Kou Shi, Xiang Shi, Qisheng Su, Xuerui Su, Hao Sun, Xiao Sun, Yanan Sun, Yu Sun, Huanze Tang, Yinghao Tang, Wenhui Tian, Zhongbo Tian, Bingli Wang, Haomin Wang, Jiarui Wang, Jingzhi Wang, Rui Wang, Xiquan Wang, Yi Wang, Zhecan Wang, Ziyi Wang, Zun Wang, Rubin Wei, Lianyi Wu, Wen Wu, Yue Wu, Yuhan Wu, Zhenyu Wu, Zijian Wu, Shuhao Xing, Jun Xu, Xingle Xu, Xuenan Xu, Xiangchao Yan, Ziang Yan, Bowen Yang, Danni Yang, Lin Yang, Zhiqi Yang, Qian Yao, Haochen Ye, Peng Ye, Jinhui Yin, Jiashuo Yu, Dingbo Yuan, Fei Yuan, Yuhang Zang, Bo Zhang, Chao Zhang, Chen Zhang, Hongjie Zhang, Junming Zhang, Wenlong Zhang, Wenwei Zhang, Yiming Zhang, Zhuo Zhang, Ziyang Zhang, Haiteng Zhao, Penghao Zhao, Yibo Zhao, Zhonghan Zhao, Zhihang Zhong, Bowen Zhou, Peiheng Zhou, Xin Zhou, Xinyu Zhou, Yunhua Zhou, Dongsheng Zhu, Yicheng Zou
Intern-S2-Preview 是一系列面向科学发现的智能体基础模型,支持多模态科学理解、推理、生成和长周期任务。训练流程包含科学多模态预训练、监督微调、多任务强化学习及智能体 RL,并引入部分 rollout、自适应长度正则化等技巧提升稳定性。其中 Intern-S2-Preview-397B 在 SciTS 时间序列基准上取得领先表现,同时其时间序列模块增强了科学信号理解与预测。独立的 Intern-MemDec-4B 扩展将 Biology-Instructions 平均分从 56.92 提升至 60.32,且无需修改冻结的 397B 主干。
推荐理由:这个科学智能体模型能处理多模态数据,397B 版在时间序列预测上很强,还有个 4B 小模型能直接把生物任务分数拉高,适合搞科研的人看看。
8月13日
8月12日
04:05
8月11日
8月10日
11:06
11:06官方账号arXiv cs.AI@Valentin Liévin, Samuel Schmidgall, Tim Strother, Alex Bijamov, Akshay Goel, Anil Palepu, Chunjong Park, Vahid Balazadeh, Min Woo Sun, Marius Guerard, Justin Chen, Dave Steiner, Vikram Dhillon, Ibrahim Azar, Akhil Mehta, Nicholas Spetsieris, Shilpan Shah, Maen Abdelrahim, Amit Dahiya, Yun Liu, Katherine Chou, Yossi Matias, Avinatan Hassidim, Dale R. Webster, Quoc V. Le, Raia Hadsell, Joelle Barral, Carey Radebaugh, Aleksandra Faust, Shekoofeh Azizi, Mike Schaekermann, Po-Hsuan Cameron Chen, Tao Tu, David Racz, Lin Yang
ResidencyRL通过强化学习在模拟临床环境中训练医疗AI,每个轨迹最多包含60轮对话和8次工具调用。在对抗条件下,该智能体的诊断准确率达到88.0%,比基础模型提升7.0%。漏诊红旗率降低31%,表明能有效减少过早闭合。盲审临床专家在87.6%的对比中更偏好训练后的智能体。在AMIE多访基准的六个临床轴上均超过基础模型。
推荐理由:医疗AI训练新方法ResidencyRL,模拟临床对话,诊断准确率涨7%,漏诊率降31%,专家更看好。
8月7日
12:30
12:30官方账号arXiv cs.LG@Chenglong Wang, Ziming Zhu, Yifu Huo, Bei Li, Qiaozhi He, Yan Ding, Xiaoyang Hao, Yuxin Gao, Tianhua Zhou, Xiaojia Chang, Tongran Liu, Jingbo Zhu
生成式奖励模型在响应排序上表现出色,但其比较性输出与强化学习要求的标量奖励不匹配。为此论文提出 RRC(Ranking-based Reward Construction),通过相对偏好排序构造奖励信号。RRC 包含自竞争排序和锚定引导排序两种互补策略,分别利用采样响应间的比较和小规模参考响应实现可扩展构造。实验在开放对话和推理基准上验证,RRC 相比现有方法持续提升强化学习训练效果。
推荐理由:这篇论文提出 RRC,能把生成式奖励模型的排序结果转成强化学习能用的信号,在对话和推理任务上比现有方法更稳定地提升训练效果。
09:22
09:22官方账号arXiv cs.AI@Saugat Adhikari, Ashok Prasad Neupane, Pramish Paudel, Ajad Chhatkuli, Danda Pani Paudel
iARCS 框架用迭代智能体强化学习,让预训练场景生成器适配自然语言任务要求。它采用两阶段策略:先用通用奖励预训练提升物理合理性,再用 LLM 生成的奖励程序做任务特定微调。实验在可步行性、可达性和间隙约束任务上提升了约束保真度,同时场景多样性保持竞争力。iARCS 生成的数据还能反过来改进基础生成器。
推荐理由:iARCS 用强化学习让 3D 场景生成器听懂自然语言要求,走路、够东西这些约束都能满足,还能提升基础生成器。