09:28官方账号arXiv cs.LG@Xuanyu Lei, Yiqi Zhu, Chenliang Li, Kaiming Liu, Peng Li, Ming Yan, Jieping Ye, Ya-Qin Zhang, Yang LiuState2State是一种从环境交互中派生训练目标的方法,无需外部指定的任务或人工监督。它通过规则匹配状态来验证智能体是否到达目标状态,从而提供可扩展且可验证的训练信号。在ALFWorld和ScienceWorld基准上,State2State作为独立训练阶段在多数设置下提升了智能体性能。用作下游强化学习的初始化时,它进一步提高了最终性能和采样效率,并展现出跨环境泛化的潜力。论文State2StateALFWorldScienceWorld推荐理由:这篇论文提出了一种不用人工任务标注的训练方法,让LLM智能体自己从环境里找目标学,在ALFWorld和ScienceWorld上有效,还能给后续强化学习打底子。原文稍后读已读值得跟进有用关注 State2State
09:35官方账号arXiv cs.AI@Wenjun Wang, Yuchen Fang, Fengrui Liu, Zibo Liang, Kai Zheng71°提出Experience Memory Graph (EMG)框架,将智能体失败恢复转化为图匹配问题。训练时将失败轨迹和专家轨迹转化为有向动作决策图,通过图匹配提取公共子图(成功工作流)和图编辑路径,存储于记忆图中。测试时无需试错循环,单次执行即可纠正错误。在ALFWorld和ScienceWorld基准上,EMG在成功率和平均奖励上持续优于现有反思基线。论文EMG智能体错误纠正推荐理由:这篇论文用图匹配让智能体一次纠正错误,不用反复试错,在ALFWorld和ScienceWorld上效果比现有方法更好。原文稍后读已读值得跟进有用关注 EMG
09:51官方账号arXiv cs.AI@Yanping Chen, Weijie Shi, Wen Yang, Jiajie XuSkillReranker通过任务和技能两侧的语义分解,生成子任务描述和执行状态描述,并构建有向无环执行图。该框架利用交叉编码器对每个任务区间的候选技能进行综合评分,选择最合适的技能集。在ALFWorld和ScienceWorld两个基准上的实验表明,SkillReranker有效提升了任务完成率,减少了环境交互步骤和token消耗。论文SkillRerankerALFWorldScienceWorld推荐理由:这篇论文提出了SkillReranker,在智能体任务中通过任务分解引导技能重排序,比传统方法更准更省token,具体在ALFWorld和ScienceWorld上验证了效果。原文稍后读已读值得跟进有用关注 SkillReranker