论文10:16基于扩散模型的离线深度Q*估计这篇用扩散模型估计奖励和转移核,再学Q*,收敛率给得很细,还绕开了RL里常见的完整性假设。#扩散模型#离线强化学习#Q*估计#Bellman算子aarXiv cs.LG@Xiaohong Chen 等 5 人原文稍后读已读值得跟进有用关注 扩散模型