10:27官方一手arXiv: DeepSeek@Shuyu Liu一项研究提出了新的测量协议,在固定24轮预算和确定性规划环境中评估上下文压缩对工具使用智能体交互成本的影响。实验覆盖三个模型和两种任务,发现检索调用在所有六种模型-任务组合中都增加,且几乎贡献了全部额外交互。5倍压缩时任务完成率无显著变化,但GPT-5.5的检索调用从21.0增至63.9次(p=.002),完成率从80%变为85%(p=1.0)。DeepSeek仅在接受10倍压缩时出现显著完成率下降。在ALFWorld环境中,压缩未引发检索激增,说明该交互成本依赖于具体任务环境而非上下文缩短本身。论文上下文压缩智能体GPT-5.5推荐理由:这篇论文用GPT-5.5和DeepSeek实测发现,压缩上下文会让智能体反复重新查工具,任务成功率却没变。想知道为什么只看完成率会骗人,可以读读。原文稍后读已读值得跟进有用关注 上下文压缩
07:52elvis@omarsar076°Meta 新研究提出 EvoHarness-RL,让智能体离线学习 harness 策略并在运行时在线构建外部状态。该策略利用 Belief、Progress、Experience 三类状态,先通过监督微调学习动作空间,再使用成本感知 GRPO 优化。基于 Qwen3-8B 的智能体在 ALFWorld 基准上达到 96.9%。训练中出现 harness annealing 和 harness evolution 两种动态,前者将重复模式吸收进模型策略,后者压缩工作区为紧凑状态。研究认为长程智能体更取决于可训练协调策略,而非更大工具或记忆。论文EvoHarness-RLMetaQwen3-8B推荐理由:Meta 新论文让智能体学会管理外部记忆,Qwen3-8B 在 ALFWorld 到 96.9%,长任务不用堆工具。原文稍后读已读值得跟进有用关注 EvoHarness-RL
09:28官方账号arXiv cs.LG@Xuanyu Lei, Yiqi Zhu, Chenliang Li, Kaiming Liu, Peng Li, Ming Yan, Jieping Ye, Ya-Qin Zhang, Yang LiuState2State是一种从环境交互中派生训练目标的方法,无需外部指定的任务或人工监督。它通过规则匹配状态来验证智能体是否到达目标状态,从而提供可扩展且可验证的训练信号。在ALFWorld和ScienceWorld基准上,State2State作为独立训练阶段在多数设置下提升了智能体性能。用作下游强化学习的初始化时,它进一步提高了最终性能和采样效率,并展现出跨环境泛化的潜力。论文State2StateALFWorldScienceWorld推荐理由:这篇论文提出了一种不用人工任务标注的训练方法,让LLM智能体自己从环境里找目标学,在ALFWorld和ScienceWorld上有效,还能给后续强化学习打底子。原文稍后读已读值得跟进有用关注 State2State
11:53官方账号arXiv cs.LG@Yi Yang, Zhennan Chen, Yihong Zhuang, Tiehan Fan, Yinan Chen, Jian Li, Jian Yang, Ying TaiRoMeRL将轨迹索引效用空间表示为按结果极性和记忆动态分解的固定维度任务记忆状态。在ALFWorld和LifelongAgentBench上,RoMeRL将Cold-Q比率降低80.0%,反馈密度提高约6.0倍。同时维护记忆大小减少84.4%,LLM调用减少21.1%。论文从理论上证明降阶参数化能增加每个效用坐标的平均反馈,代码已开源。论文RoMeRL智能体记忆系统推荐理由:这论文把智能体记忆里反馈分散和奖励污染的问题一起解决了,Cold-Q降了80%,记忆体积缩了84%,效果很硬核。原文稍后读已读值得跟进有用关注 RoMeRL
11:55官方账号arXiv cs.AI@Rong Wu, Daocheng Fu, Licheng Wen, Xuemeng Yang, Shu Zou, Jianbiao Mei, Yuxin Wang, Hairong Zhang, Yu Yang, Tao Hu, Cong Zhang, Botian Shi, Pinlong CaiMemHarness 框架在决策时用统一策略模型批判并重构检索到的经验,而不是像基线那样逐字回放。重构能力通过 GRPO 端到端训练自然涌现,无需额外监督。在 ALFWorld 和 WebShop 两个基准上,MemHarness 显著超过纯 RL 和静态记忆增强基线。分析表明,MemHarness 的重构目标可防止负迁移,并在 OOD 场景中保持鲁棒性。论文MemHarnessALFWorldWebShop推荐理由:MemHarness 让智能体把旧经验改写到当前场景再用,在 ALFWorld 和 WebShop 上比静态记忆基线强不少。原文稍后读已读值得跟进有用关注 MemHarness
10:12官方账号arXiv cs.AI@Yipeng Shi, Zhipeng Ma, Yue Wang, Qitai Tan, Yang Li, Peng Chen, Zhengzhou ZhuPATS是一种针对长周期LLM智能体强化学习的策略中心训练范式。它将最近的rollout分组转换为证据卡,并通过任务特定评估调整后续rollout的上下文。在ALFWorld和WebShop上,PATS相比强基线提升最高达18.6%。在7个搜索增强QA基准上,PATS在保持竞争力的同时比基线减少32.1%的提示token。该方法在部署时丢弃训练支架,不增加推理开销。AI模型PATS强化学习智能体推荐理由:PATS用动态训练支架帮弱策略少犯错,ALFWorld和WebShop上最高提升18.6%,而且部署时没负担。原文稍后读已读值得跟进有用关注 PATS
09:35官方账号arXiv cs.AI@Wenjun Wang, Yuchen Fang, Fengrui Liu, Zibo Liang, Kai Zheng71°提出Experience Memory Graph (EMG)框架,将智能体失败恢复转化为图匹配问题。训练时将失败轨迹和专家轨迹转化为有向动作决策图,通过图匹配提取公共子图(成功工作流)和图编辑路径,存储于记忆图中。测试时无需试错循环,单次执行即可纠正错误。在ALFWorld和ScienceWorld基准上,EMG在成功率和平均奖励上持续优于现有反思基线。论文EMG智能体错误纠正推荐理由:这篇论文用图匹配让智能体一次纠正错误,不用反复试错,在ALFWorld和ScienceWorld上效果比现有方法更好。原文稍后读已读值得跟进有用关注 EMG
09:51官方账号arXiv cs.AI@Yanping Chen, Weijie Shi, Wen Yang, Jiajie XuSkillReranker通过任务和技能两侧的语义分解,生成子任务描述和执行状态描述,并构建有向无环执行图。该框架利用交叉编码器对每个任务区间的候选技能进行综合评分,选择最合适的技能集。在ALFWorld和ScienceWorld两个基准上的实验表明,SkillReranker有效提升了任务完成率,减少了环境交互步骤和token消耗。论文SkillRerankerALFWorldScienceWorld推荐理由:这篇论文提出了SkillReranker,在智能体任务中通过任务分解引导技能重排序,比传统方法更准更省token,具体在ALFWorld和ScienceWorld上验证了效果。原文稍后读已读值得跟进有用关注 SkillReranker
10:36官方账号arXiv cs.AI@Yuanda Xu, Zhengze Zhou, Hejian Sang, Xiaomin Li, Jiaxin Zhang, Xinchen Du, Zhipeng Wang, Alborz Geramifard论文提出TRIAGE框架,通过将动作段分类为决断性进展、有用探索、无进展基础设施或回归,并分配固定边界奖励,解决了标准GRPO仅依赖最终结果信号的盲点。在ALFWorld、Search-QA和WebShop三个基准上,TRIAGE基于两种策略模型均提升了成功率。消融实验表明,角色类型化(尤其是检测成功轨迹中的回归行为)是性能提升的主要来源,且TRIAGE在ALFWorld和WebShop上分别比GRPO减少了10.4%和14.8%的环境交互轮次。论文TRIAGEGRPOALFWorld推荐理由:想改进智能体强化学习的信用分配?TRIAGE通过角色类型化标签给不同动作段不同奖励,效果超过GRPO,还能少绕弯路。原文稍后读已读值得跟进有用关注 TRIAGE
13:54官方账号arXiv cs.AI@Xuan Zhang, Wenxuan Zhang, See-Kiong Ng, Yang DengWorldEvolver是一个自进化世界模型框架,在部署时通过记忆模块修正上下文,同时保持下游智能体和模型参数冻结。它包含三个模块:Episodic Memory利用检索模拟实际动作转换,Semantic Memory从预测-观测不匹配中提取启发式规则,Selective Foresight过滤低置信度预测。在ALFWorld和ScienceWorld上评估,WorldEvolver在Word2World上取得最高预测准确率,并在AgentBoard上显著提升下游智能体成功率。实验表明,测试时记忆修正同时增强了预测保真度和规划性能。论文WorldEvolverLLM世界模型推荐理由:WorldEvolver通过三种记忆模块让智能体的世界模型在测试时自我进化,在ALFWorld和ScienceWorld上预测准确率最高,下游成功率也领先其他方法。原文稍后读已读值得跟进有用关注 WorldEvolver
09:44官方账号arXiv cs.AI@Peng Xu, Sijia Chen, Junzhuo Li, Xuming Hu论文提出SCPO,一种价值无关的奖励塑造方法,通过对比同组内成功与失败轨迹的中间步骤,为失败步骤恢复正向信用。该方法解决了因轨迹最终结果不同导致语义相似的中间步骤获得相反信用的问题。在ALFWorld基准上,1.5B参数模型达到93.7%±4.1%成功率;在WebShop基准上达到74.8%±2.0%成功率,提升集中在最难的多步任务。论文SCPOALFWorldWebShop推荐理由:这篇论文解决了强化学习给LLM智能体分配奖励时的一个逻辑问题:相同意思的步骤因轨迹成败拿了相反信用。SCPO在ALFWorld和WebShop上跑分挺高,最难的步骤提升明显。原文稍后读已读值得跟进有用关注 SCPO
12:04官方一手arXiv: DeepSeek@Aman Mehta, Anupam Datta该论文提出replay pairing诊断方法,测量LLM代理中计划信号随上下文步数的衰减。在Llama-3.1-70B上,计划信号在计划后一步骤达到0.453,随后单步动作-观察步骤下降4.1倍。推理模型如DeepSeek-R1-Distill-Llama-70B存在推理痕迹混淆,严格剥离后恢复+153%信号。计划驱逐导致ALFWorld成功率下降34.7个百分点。研究显示代理关键信息依赖上下文存在而非持久化。论文Llama-3.1-70BDeepSeek-R1-Distill-Llama-70BALFWorld推荐理由:这篇论文用实验证明LLM代理离了上下文里的计划就抓瞎,不是脑子记住了。对做多步任务代理的人很有启发。原文稍后读已读值得跟进有用关注 Llama-3.1-70B