12:25官方账号arXiv cs.AI@Jinhe Bi, Chennan Zhou, Zengjie Jin, Aniri, Shuo Lu, Wenke Huang, Hu Cao, Xun Xiao, Zhihong Zhu, Volker Tresp, Fei Shen, Yunpu Ma, Tat-Seng ChuaReflectRL 提出从专家模型的失败轨迹中学习推理,将失败样本视为反思对象而非模仿示范。该方法基于“反思优势”假设:对难题,反思有缺陷的轨迹比从头求解更有效。ReflectRL 先利用失败轨迹生成反思推理,再通过“反思到直接策略迁移”将能力转移。在 9 个基准、4 种 LLM 骨干和 4 种在线训练方法上,ReflectRL 稳定提升推理性能且开销极小。论文ReflectRL推理模型在线训练推荐理由:ReflectRL 把失败样本当教材,让模型先反思再直接推理。在 9 个基准上稳定提升,还挺轻量。原文稍后读已读值得跟进有用关注 ReflectRL
11:10官方账号arXiv cs.AI@Rui Yang, Qianhui Wu, Yuxi Chen, Hao Bai, Wenlin Yao, Hao Cheng, Baolin Peng, Huan Zhang, Tong Zhang, Jianfeng Gao精选76°OpenWebRL 是一个开源框架,用于在真实网站上通过在线多轮强化学习训练视觉网页智能体。该框架覆盖完整训练流程,包括可扩展的实时浏览器基础设施、监督初始化、多模态上下文管理、轨迹级成功判断和高效的多轮策略优化。基于此框架训练的 OpenWebRL-4B 模型仅用 0.4K 初始化轨迹和 2.2K 开放 RL 训练任务,就在 Online-Mind2Web 和 DeepShop 基准上分别达到 67.0% 和 64.0% 的成功率,超越了同规模或更大规模的开源智能体,并接近 OpenAI CUA 和 Gemini CUA 等专有系统。这项工作解决了高质量演示数据收集昂贵和静态数据集覆盖有限的问题,为构建更强大、可复现且成本高效的开源网页智能体提供了实用路径。论文视觉网页智能体多轮强化学习开源框架8 个信源在谈事件专题推荐理由:做网页自动化或视觉智能体的开发者终于有了一个开源的在线RL训练方案——OpenWebRL 用极少的训练数据就达到了接近专有系统的效果,值得直接拿来试试。原文稍后读已读值得跟进有用关注 视觉网页智能体