AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

LLM agent

共 3 条相关 AI 资讯
7月21日
09:37
09:37官方账号arXiv cs.LG@Babak Barazandeh, Subhabrata Majumdar, George Michailidis
当前Agent轨迹评估依赖二进制成功标志或精确匹配,无法区分侥幸成功或分析失败原因。Otap将轨迹评估转化为执行图与有效解图之间的最优传输距离,基于不平衡融合Gromov-Wasserstein问题。该伪度量对保持依赖的重新排序具有不变性,对冗余步骤敏感度有限,并能处理缺失或幻觉步骤。在受控扰动和三个公开基准上,Otap在语义指标低于随机水平的场景中仍能有效区分有效与无效轨迹。其准确性在依赖图精确恢复时最高,在从自由文本推断时下降。
论文OtapAgent轨迹规划评估

推荐理由:这篇论文提出了Otap,一个用最优传输来评估Agent轨迹的新方法。它不再只看任务成功与否,而是分析执行结构,还能容忍不同的规划顺序和冗余步骤。
原文
7月15日
11:37
11:37官方账号arXiv cs.AI@Junjie Yin, Xinyu Feng
该论文提出E3(Estimate, Execute, Expand)框架,让LLM Agent先估计任务难度,再执行最小可行路径,仅在验证失败时扩展范围。在MSE-Bench基准(121次编辑任务)上,E3在保持100%成功率的同时,将成本降低85%,tokens减少91%,检查文件数减少92%,并比强适应性检索基线高出16%。在gpt-4o真实库编辑实验中,E3是同等成功率下最轻量最快的策略。
论文E3MSE-BenchLLM agent

推荐理由:这篇论文解决了AI agent过度读取文件的问题,E3方法能自动判断任务简单就少干活,在MSE-Bench上省了85%成本,效果很实在。
原文
6月26日
09:59
09:59官方账号arXiv cs.AI@Shicheng Ye, Chao Yu
JERP(Joint Learning of Experiential Rules and Policies)是一种让LLM智能体同时从交互轨迹中更新经验规则池和策略的方法。该方法在决策时检索任务相关规则,并结合交互历史指导行动;每轮结束后,利用轨迹对比参考成功案例来优化策略与修正规则池。在AlfWorld和WebShop两个基准测试上,JERP在复杂交互任务中持续提升了决策性能。这一耦合机制使规则池与演化策略保持同步,同时将稳定有效行为逐步吸收到模型参数中。
论文JERPLLM agent经验规则

推荐理由:这篇论文提出了JERP,让LLM智能体边干活边总结经验规则,在AlfWorld和WebShop上效果明显。
原文
精选全部日报登录