UOPD:用不确定性感知干预改进多轮智能体的在线蒸馏
这篇论文给多轮智能体蒸馏提了个新思路:只在学生拿不准的步骤让老师出手纠正,WebShop 分数最多提升 15.8%。做 Agent 训练的可以看看干预时机的选择。
这篇论文给多轮智能体蒸馏提了个新思路:只在学生拿不准的步骤让老师出手纠正,WebShop 分数最多提升 15.8%。做 Agent 训练的可以看看干预时机的选择。
这篇论文解决了强化学习给LLM智能体分配奖励时的一个逻辑问题:相同意思的步骤因轨迹成败拿了相反信用。SCPO在ALFWorld和WebShop上跑分挺高,最难的步骤提升明显。