AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

自反策略优化

共 1 条相关 AI 资讯
8月25日
10:43
10:43官方账号arXiv cs.AI@Jialong Liu, Yuling Shi, Ning Yang, Xiaodong Gu, Zuchao Li
SRPO是一种框架,使LLMs能够分析自身轨迹,将错误合成简洁的'反思补丁',并使用条件教师分数作为密集的token级训练信号。在数学推理和长期代理基准测试中,SRPO实现了最先进的性能,使用Qwen3-8B基模型,在AIME'24上达到73.3%,仅使用8%的训练FLOPs,同时显著提高WebShop(64.7%)、ALFWorld(76.8%)和SWE-Bench-Lite(31.2%)的成功率。
论文自反策略优化长期推理LLM

推荐理由:SRPO框架使LLMs能够自我分析,提高长期推理能力,比传统方法更高效。
原文
精选全部日报登录