论文精选11:28QGF:测试时策略优化,用价值梯度引导流模型生成高回报动作做机器人控制或连续控制RL的团队,如果受困于扩散/流模型训练的不稳定性,QGF提供了一种“训练照旧、测试优化”的实用方案,值得一试。#强化学习#流模型#测试时优化#QGFaarXiv cs.AI@Zhiyuan Zhou 等 7 人原文稍后读已读值得跟进有用关注 强化学习