论文09:14SAO: 单轨迹异步优化稳定训练智能体强化学习想高效训练智能体模型?SAO用单轨迹采样打补丁,稳定训练1000步,在编码和推理基准上全面超越GRPO,干货论文。#SAO#GRPO#GLM-5.2#强化学习aarXiv cs.AI@Zhenyu Hou 等 4 人原文稍后读已读值得跟进有用关注 SAO