10:43官方账号arXiv cs.LG@Haoyu Zheng, Yun Zhu, Qing Wang, Wenqiao ZhangTRIAL提出统一回合对齐评分协议,为每个决策回合提取结果视图并比较普通与事后条件下的响应,以有符号对数概率差分配标记级监督。在WebShop和ALFWorld上使用不同骨干模型,TRIAL在全部八种组合中超越GRPO,并在六种组合中达到最优或并列最优。使用Qwen3-1.7B时,WebShop成功率从56.4%提升至75.2%,任务分数从78.7%提升至85.7%。消融实验显示,轨迹相对的回合分配比单纯密集事后蒸馏带来更大提升。论文TRIALGRPOQwen3推荐理由:这个新框架TRIAL能让智能体强化学习更高效,在多个任务上超过GRPO,成功率提升近19个百分点,搞RL的可以看看。原文稍后读已读值得跟进有用关注 TRIAL