8月6日
09:28
09:28官方账号arXiv cs.LG@Xuanyu Lei, Yiqi Zhu, Chenliang Li, Kaiming Liu, Peng Li, Ming Yan, Jieping Ye, Ya-Qin Zhang, Yang Liu
State2State是一种从环境交互中派生训练目标的方法,无需外部指定的任务或人工监督。它通过规则匹配状态来验证智能体是否到达目标状态,从而提供可扩展且可验证的训练信号。在ALFWorld和ScienceWorld基准上,State2State作为独立训练阶段在多数设置下提升了智能体性能。用作下游强化学习的初始化时,它进一步提高了最终性能和采样效率,并展现出跨环境泛化的潜力。
推荐理由:这篇论文提出了一种不用人工任务标注的训练方法,让LLM智能体自己从环境里找目标学,在ALFWorld和ScienceWorld上有效,还能给后续强化学习打底子。
7月8日
09:51
09:51官方账号arXiv cs.AI@Yanping Chen, Weijie Shi, Wen Yang, Jiajie Xu
SkillReranker通过任务和技能两侧的语义分解,生成子任务描述和执行状态描述,并构建有向无环执行图。该框架利用交叉编码器对每个任务区间的候选技能进行综合评分,选择最合适的技能集。在ALFWorld和ScienceWorld两个基准上的实验表明,SkillReranker有效提升了任务完成率,减少了环境交互步骤和token消耗。
推荐理由:这篇论文提出了SkillReranker,在智能体任务中通过任务分解引导技能重排序,比传统方法更准更省token,具体在ALFWorld和ScienceWorld上验证了效果。