10:43官方账号arXiv cs.AI@Jialong Liu, Yuling Shi, Ning Yang, Xiaodong Gu, Zuchao LiSRPO是一种框架,使LLMs能够分析自身轨迹,将错误合成简洁的'反思补丁',并使用条件教师分数作为密集的token级训练信号。在数学推理和长期代理基准测试中,SRPO实现了最先进的性能,使用Qwen3-8B基模型,在AIME'24上达到73.3%,仅使用8%的训练FLOPs,同时显著提高WebShop(64.7%)、ALFWorld(76.8%)和SWE-Bench-Lite(31.2%)的成功率。论文自反策略优化长期推理LLM推荐理由:SRPO框架使LLMs能够自我分析,提高长期推理能力,比传统方法更高效。原文稍后读已读值得跟进有用关注 自反策略优化
01:10AK@_akhaliqEgoMemReason 是一个新的基准测试,专门用于评估 AI 在长时间自我中心视频理解中的记忆驱动推理能力。该基准要求模型在观看长视频后,基于记忆回答关于事件顺序、因果关系和细节的问题。它填补了现有视频理解基准在长期记忆和推理方面的空白,对开发更智能的视觉助手和机器人有重要意义。论文基准测试视频理解记忆推理推荐理由:做视频理解或具身智能的团队终于有了一个专门测试长期记忆推理的基准——EgoMemReason 直击当前模型在长视频中“看完就忘”的痛点,做相关研究的建议直接拿来评估自己的模型。原文稍后读已读值得跟进有用关注 基准测试