12:10官方账号arXiv cs.AI@Xiao Yu, Baolin Peng, Ruize Xu, Hao Zou, Qianhui Wu, Hao Cheng, Wenlin Yao, Nikhil Singh, Zhou Yu, Jianfeng GaoOpenForgeRL 是一个开源框架,用于端到端训练基于推理 harness(如 Claude Code、Codex)的智能体。它通过轻量级代理记录模型调用作为训练数据,并使用 Kubernetes 编排器在远程容器中执行 rollout。在 ClawEval 上达到 31.7 pass^3 和 55.9 pass@3,在 QwenClawBench 上达到 33.7。GUI 基准测试中,OSWorld-Verified 得分 37.7,Online-Mind2Web 得分 63.0,WebVoyager 得分 72.3。这些结果超越同规模开源基线,在 GUI 场景中甚至匹配或超越数倍大的模型。AI模型OpenForgeRL智能体强化学习推荐理由:想用强化学习训练自己的 Claude Code 智能体?OpenForgeRL 让你在真实 harness 和环境中端到端训练,ClawEval 和 GUI 基准上表现不错,而且开源可用。原文稍后读已读值得跟进有用关注 OpenForgeRL