8月5日
11:46
11:46官方账号arXiv cs.LG@Tianyi Guan, Yiding Wang, Haotong Yang, Siyuan Cao, Shirui Liu, Yi Hu, Jiaqi Li, Muhan Zhang
新基准 ContinualSkillBench 用于评估智能体的持续技能学习,覆盖五个领域、100 个按难度递增且可复用技能的互联子任务。实验表明序列执行总体能提升性能,但收益因模型和领域而异。上下文学习与显式技能维护平均表现相当,显式技能只在需要可复用流程或精确输出的任务上更有优势。较弱模型反而会积累更大、更碎片化的任务技能集合。
推荐理由:这篇论文给了一套测试方法,来验证 LLM 智能体到底会不会把经验变成可复用的技能,而不是光靠记住上下文。