11:55官方账号arXiv cs.AI@Rong Wu, Daocheng Fu, Licheng Wen, Xuemeng Yang, Shu Zou, Jianbiao Mei, Yuxin Wang, Hairong Zhang, Yu Yang, Tao Hu, Cong Zhang, Botian Shi, Pinlong CaiMemHarness 框架在决策时用统一策略模型批判并重构检索到的经验,而不是像基线那样逐字回放。重构能力通过 GRPO 端到端训练自然涌现,无需额外监督。在 ALFWorld 和 WebShop 两个基准上,MemHarness 显著超过纯 RL 和静态记忆增强基线。分析表明,MemHarness 的重构目标可防止负迁移,并在 OOD 场景中保持鲁棒性。论文MemHarnessALFWorldWebShop推荐理由:MemHarness 让智能体把旧经验改写到当前场景再用,在 ALFWorld 和 WebShop 上比静态记忆基线强不少。原文稍后读已读值得跟进有用关注 MemHarness
10:12官方账号arXiv cs.AI@Yipeng Shi, Zhipeng Ma, Yue Wang, Qitai Tan, Yang Li, Peng Chen, Zhengzhou ZhuPATS是一种针对长周期LLM智能体强化学习的策略中心训练范式。它将最近的rollout分组转换为证据卡,并通过任务特定评估调整后续rollout的上下文。在ALFWorld和WebShop上,PATS相比强基线提升最高达18.6%。在7个搜索增强QA基准上,PATS在保持竞争力的同时比基线减少32.1%的提示token。该方法在部署时丢弃训练支架,不增加推理开销。AI模型PATS强化学习智能体推荐理由:PATS用动态训练支架帮弱策略少犯错,ALFWorld和WebShop上最高提升18.6%,而且部署时没负担。原文稍后读已读值得跟进有用关注 PATS
10:36官方账号arXiv cs.AI@Yuanda Xu, Zhengze Zhou, Hejian Sang, Xiaomin Li, Jiaxin Zhang, Xinchen Du, Zhipeng Wang, Alborz Geramifard论文提出TRIAGE框架,通过将动作段分类为决断性进展、有用探索、无进展基础设施或回归,并分配固定边界奖励,解决了标准GRPO仅依赖最终结果信号的盲点。在ALFWorld、Search-QA和WebShop三个基准上,TRIAGE基于两种策略模型均提升了成功率。消融实验表明,角色类型化(尤其是检测成功轨迹中的回归行为)是性能提升的主要来源,且TRIAGE在ALFWorld和WebShop上分别比GRPO减少了10.4%和14.8%的环境交互轮次。论文TRIAGEGRPOALFWorld推荐理由:想改进智能体强化学习的信用分配?TRIAGE通过角色类型化标签给不同动作段不同奖励,效果超过GRPO,还能少绕弯路。原文稍后读已读值得跟进有用关注 TRIAGE
09:59官方账号arXiv cs.AI@Shicheng Ye, Chao YuJERP(Joint Learning of Experiential Rules and Policies)是一种让LLM智能体同时从交互轨迹中更新经验规则池和策略的方法。该方法在决策时检索任务相关规则,并结合交互历史指导行动;每轮结束后,利用轨迹对比参考成功案例来优化策略与修正规则池。在AlfWorld和WebShop两个基准测试上,JERP在复杂交互任务中持续提升了决策性能。这一耦合机制使规则池与演化策略保持同步,同时将稳定有效行为逐步吸收到模型参数中。论文JERPLLM agent经验规则推荐理由:这篇论文提出了JERP,让LLM智能体边干活边总结经验规则,在AlfWorld和WebShop上效果明显。原文稍后读已读值得跟进有用关注 JERP
09:44官方账号arXiv cs.AI@Peng Xu, Sijia Chen, Junzhuo Li, Xuming Hu论文提出SCPO,一种价值无关的奖励塑造方法,通过对比同组内成功与失败轨迹的中间步骤,为失败步骤恢复正向信用。该方法解决了因轨迹最终结果不同导致语义相似的中间步骤获得相反信用的问题。在ALFWorld基准上,1.5B参数模型达到93.7%±4.1%成功率;在WebShop基准上达到74.8%±2.0%成功率,提升集中在最难的多步任务。论文SCPOALFWorldWebShop推荐理由:这篇论文解决了强化学习给LLM智能体分配奖励时的一个逻辑问题:相同意思的步骤因轨迹成败拿了相反信用。SCPO在ALFWorld和WebShop上跑分挺高,最难的步骤提升明显。原文稍后读已读值得跟进有用关注 SCPO