#ALFWorld
共 20 条 · 7 天 3 条 · 30 天 6 条
信息流里打上「ALFWorld」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月7日
10月5日
AdaStep:用自适应步级权重改进智能体强化学习训练
训练长程智能体的朋友可以看看这篇,它解决了步级信用分配噪声大的问题,而且不用加 critic,成本很低,在 ALFWorld 等三个环境都有提升。
9月30日
9月29日
UOPD:用不确定性感知干预改进多轮智能体的在线蒸馏
这篇论文给多轮智能体蒸馏提了个新思路:只在学生拿不准的步骤让老师出手纠正,WebShop 分数最多提升 15.8%。做 Agent 训练的可以看看干预时机的选择。
9月26日
9月2日
8月26日
8月18日
论文10:27
上下文压缩的隐性代价:智能体交互成本测量这篇论文用GPT-5.5和DeepSeek实测发现,压缩上下文会让智能体反复重新查工具,任务成功率却没变。想知道为什么只看完成率会骗人,可以读读。
8月10日
8月6日
论文09:28
State2State:环境派生的LLM智能体中期训练方法这篇论文提出了一种不用人工任务标注的训练方法,让LLM智能体自己从环境里找目标学,在ALFWorld和ScienceWorld上有效,还能给后续强化学习打底子。
8月4日
论文11:53
RoMeRL:通过降阶效用状态平衡自进化智能体记忆中的反馈覆盖与记忆-奖励陷阱这论文把智能体记忆里反馈分散和奖励污染的问题一起解决了,Cold-Q降了80%,记忆体积缩了84%,效果很硬核。
7月31日
7月24日
7月16日
7月8日
论文09:51
自适应智能体技能检索的任务分解引导重排序这篇论文提出了SkillReranker,在智能体任务中通过任务分解引导技能重排序,比传统方法更准更省token,具体在ALFWorld和ScienceWorld上验证了效果。
7月1日
6月30日
论文13:54
WorldEvolver:自进化世界模型提升LLM智能体规划WorldEvolver通过三种记忆模块让智能体的世界模型在测试时自我进化,在ALFWorld和ScienceWorld上预测准确率最高,下游成功率也领先其他方法。
6月25日
论文09:44
SCPO: 语义一致性策略优化用于LLM智能体强化学习这篇论文解决了强化学习给LLM智能体分配奖励时的一个逻辑问题:相同意思的步骤因轨迹成败拿了相反信用。SCPO在ALFWorld和WebShop上跑分挺高,最难的步骤提升明显。
6月23日