10:12官方账号arXiv cs.AI@Yipeng Shi, Zhipeng Ma, Yue Wang, Qitai Tan, Yang Li, Peng Chen, Zhengzhou ZhuPATS是一种针对长周期LLM智能体强化学习的策略中心训练范式。它将最近的rollout分组转换为证据卡,并通过任务特定评估调整后续rollout的上下文。在ALFWorld和WebShop上,PATS相比强基线提升最高达18.6%。在7个搜索增强QA基准上,PATS在保持竞争力的同时比基线减少32.1%的提示token。该方法在部署时丢弃训练支架,不增加推理开销。AI模型PATS强化学习智能体推荐理由:PATS用动态训练支架帮弱策略少犯错,ALFWorld和WebShop上最高提升18.6%,而且部署时没负担。原文稍后读已读值得跟进有用关注 PATS