9月2日
10:12
10:12官方账号arXiv cs.LG@Matteo Merler, Giovanni Bonetta, Davide Zago, Rossella Cancelliere, Bernardo Magnini
73°
研究人员提出SAGE框架,通过熵值选择性查询视觉语言模型(VLM)教师。该框架在训练过程中仅在不确定时查询VLM,执行建议动作,并将指导提炼为轻量级强化学习策略。在稀疏奖励视觉推理和导航任务中,SAGE学习到的策略在评估时无需VLM指导,并在多个环境中优于无引导的强化学习。
推荐理由:SAGE框架让VLM只在关键时刻提供指导,大幅减少调用次数,学习到的策略甚至能超越VLM教师表现。