10:43官方账号arXiv cs.AI@Jialong Liu, Yuling Shi, Ning Yang, Xiaodong Gu, Zuchao LiSRPO是一种框架,使LLMs能够分析自身轨迹,将错误合成简洁的'反思补丁',并使用条件教师分数作为密集的token级训练信号。在数学推理和长期代理基准测试中,SRPO实现了最先进的性能,使用Qwen3-8B基模型,在AIME'24上达到73.3%,仅使用8%的训练FLOPs,同时显著提高WebShop(64.7%)、ALFWorld(76.8%)和SWE-Bench-Lite(31.2%)的成功率。论文自反策略优化长期推理LLM推荐理由:SRPO框架使LLMs能够自我分析,提高长期推理能力,比传统方法更高效。原文稍后读已读值得跟进有用关注 自反策略优化