论文10:43SRPO:自反策略优化用于长期推理SRPO框架使LLMs能够自我分析,提高长期推理能力,比传统方法更高效。#自反策略优化#长期推理#LLM#Qwen3-8BaarXiv cs.AI@Jialong Liu 等 5 人原文稍后读已读值得跟进有用关注 自反策略优化