9月1日
11:23
11:23官方账号arXiv cs.AI@Jingxiao Yang, Wangjie Gan, Yingxuan Zhuang, Wenqi Zhang, Jintao Chen, Xuhong Zhang
精选73°
TASPO将特权监督转化为结果导向的行动信用,在三个智能体基准测试中比GRPO提高10.6%。该方法从验证的成功经验中构建决策适用的特权信息,在可执行行动级别聚合PI引起的似然变化。TASPO将相对行动支持转换为原始轨迹优势上的正、有界、均值保留权重,验证结果确定更新方向和平均规模。
推荐理由:TASPO解决了智能体政策优化中的监督-信用差距问题,让特权信息只重新分配行动间的信用,不改变整体更新方向。