论文精选11:57RLDT:用强化学习微调流匹配策略,密度传输对齐奖励区域RLDT 解决了流匹配策略在强化学习中难以微调的痛点,做连续控制或机器人操作的团队可以直接参考其密度传输思路,比蒸馏或近似分布的方法更高效。#强化学习#流匹配#密度传输#连续控制aarXiv cs.AI@Boshu Lei 等 3 人原文稍后读已读值得跟进有用关注 强化学习