10:53官方账号arXiv cs.LG@Xinyi Li, Zaishuo Xia, Chenjie Hao, Yubei Chen论文提出直接预测世界模型DPWM,将任意长度的动作序列压缩为单一嵌入,单次前向预测终点观测。DPWM避免了递归卷展,使长时程端到端训练在自回归训练不稳定的尺度上可行。在连续控制和像素级基准上,DPWM相比递归世界模型大幅提升长时程终点预测,且预测时程越长优势越大。实验还显示,用同样的长时程目标重训递归基线也获得类似提升,说明训练目标而非骨干结构是主要驱动力。论文DPWM世界模型长时程预测推荐理由:这篇论文把世界模型的训练目标改成直接预测终点,DPWM在长时程预测上比递归模型准很多,而且越长优势越明显。想搞长时程决策的可以看看。原文稍后读已读值得跟进有用关注 DPWM