8月24日
10:58
10:58官方账号arXiv cs.AI@Huizu Lin, Chengkai Huang, Tianqi Gao, Tao Huang, Daijiao Liu, Tongxin Li, Xiaoyan Sun, Lina Yao
AUSO通过动作感知的优化过程统一技能学习和使用,使技能从外部监督源逐渐转变为决策知识,并适应其动作级效益。实验表明,AUSO在ALFWorld、WebShop和SearchQA上优于基线,提高了代理性能和泛化能力。
推荐理由:这篇论文介绍了AUSO,一种动作级统一技能优化方法,它通过动作感知的优化过程使技能从外部监督源逐渐转变为决策知识,并适应其动作级效益,值得一看。