AITP
精选全部 AI 动态AI 日报Agent 接入关于更新日志信源提报反馈
登录 / 注册
AITOP
全部 AI 动态
AI 相关资讯全量信息流
全部博客资讯推文论文
全部模型产品行业论文技巧
标签:WebShop×
6月26日
09:59
09:59arXiv cs.AI@Shicheng Ye, Chao Yu
JERP(Joint Learning of Experiential Rules and Policies)是一种让LLM智能体同时从交互轨迹中更新经验规则池和策略的方法。该方法在决策时检索任务相关规则,并结合交互历史指导行动;每轮结束后,利用轨迹对比参考成功案例来优化策略与修正规则池。在AlfWorld和WebShop两个基准测试上,JERP在复杂交互任务中持续提升了决策性能。这一耦合机制使规则池与演化策略保持同步,同时将稳定有效行为逐步吸收到模型参数中。
论文JERPLLM agent经验规则AlfWorldWebShop

推荐理由:这篇论文提出了JERP,让LLM智能体边干活边总结经验规则,在AlfWorld和WebShop上效果明显。
原文
6月25日
09:44
09:44arXiv cs.AI@Peng Xu, Sijia Chen, Junzhuo Li, Xuming Hu
论文提出SCPO,一种价值无关的奖励塑造方法,通过对比同组内成功与失败轨迹的中间步骤,为失败步骤恢复正向信用。该方法解决了因轨迹最终结果不同导致语义相似的中间步骤获得相反信用的问题。在ALFWorld基准上,1.5B参数模型达到93.7%±4.1%成功率;在WebShop基准上达到74.8%±2.0%成功率,提升集中在最难的多步任务。
论文SCPOALFWorldWebShop强化学习智能体

推荐理由:这篇论文解决了强化学习给LLM智能体分配奖励时的一个逻辑问题:相同意思的步骤因轨迹成败拿了相反信用。SCPO在ALFWorld和WebShop上跑分挺高,最难的步骤提升明显。
原文
6月16日
20:46
AITOP6月16日 20:46
600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI
6月12日
12:57
AITOP6月12日 12:57
Claude代码里藏了个20260612,18个月后的AI记忆革命已经开始倒计时
6月11日
15:28
AITOP6月11日 15:28
1107 vs 303:谷歌悄悄开源了一个“拆打字机”的模型,把大模型速度翻了4倍
15:23
AITOP6月11日 15:23
DiffusionGemma颠覆文本生成?自回归模型的“统治”要结束了
15:07
AITOP6月11日 15:07
每秒1107个token,Google开源的扩散模型为什么能改变本地推理格局?
精选全部日报登录