09:37官方账号arXiv cs.LG@Babak Barazandeh, Subhabrata Majumdar, George Michailidis当前Agent轨迹评估依赖二进制成功标志或精确匹配,无法区分侥幸成功或分析失败原因。Otap将轨迹评估转化为执行图与有效解图之间的最优传输距离,基于不平衡融合Gromov-Wasserstein问题。该伪度量对保持依赖的重新排序具有不变性,对冗余步骤敏感度有限,并能处理缺失或幻觉步骤。在受控扰动和三个公开基准上,Otap在语义指标低于随机水平的场景中仍能有效区分有效与无效轨迹。其准确性在依赖图精确恢复时最高,在从自由文本推断时下降。论文OtapAgent轨迹规划评估推荐理由:这篇论文提出了Otap,一个用最优传输来评估Agent轨迹的新方法。它不再只看任务成功与否,而是分析执行结构,还能容忍不同的规划顺序和冗余步骤。原文稍后读已读值得跟进有用关注 Otap
11:37官方账号arXiv cs.AI@Junjie Yin, Xinyu Feng该论文提出E3(Estimate, Execute, Expand)框架,让LLM Agent先估计任务难度,再执行最小可行路径,仅在验证失败时扩展范围。在MSE-Bench基准(121次编辑任务)上,E3在保持100%成功率的同时,将成本降低85%,tokens减少91%,检查文件数减少92%,并比强适应性检索基线高出16%。在gpt-4o真实库编辑实验中,E3是同等成功率下最轻量最快的策略。论文E3MSE-BenchLLM agent推荐理由:这篇论文解决了AI agent过度读取文件的问题,E3方法能自动判断任务简单就少干活,在MSE-Bench上省了85%成本,效果很实在。原文稍后读已读值得跟进有用关注 E3
09:59官方账号arXiv cs.AI@Shicheng Ye, Chao YuJERP(Joint Learning of Experiential Rules and Policies)是一种让LLM智能体同时从交互轨迹中更新经验规则池和策略的方法。该方法在决策时检索任务相关规则,并结合交互历史指导行动;每轮结束后,利用轨迹对比参考成功案例来优化策略与修正规则池。在AlfWorld和WebShop两个基准测试上,JERP在复杂交互任务中持续提升了决策性能。这一耦合机制使规则池与演化策略保持同步,同时将稳定有效行为逐步吸收到模型参数中。论文JERPLLM agent经验规则推荐理由:这篇论文提出了JERP,让LLM智能体边干活边总结经验规则,在AlfWorld和WebShop上效果明显。原文稍后读已读值得跟进有用关注 JERP