8月18日
10:19
10:19官方账号arXiv cs.LG@Huatong Song, Fei Bai, Ming Yang, Renyuan Li, Jia Deng, Jujie He, Zhange Zhang, Daixuan Cheng, Yan Xing, Qi Yun, Xuxing Chen, Danyang Li, Feng Chang, Chuan Hao, Ran Tao, Jian Yang, Bryan Dai, Wayne Xin Zhao, Mingjie Tang, Ji-Rong Wen
ClawGym II提出一种统一的黑盒强化学习框架,用于通过复杂harness稳定优化通用agent。该框架基于沙箱执行基础设施隔离任务环境,并在模型边界放置代理捕获模型调用,将捕获的调用组织成前缀树以重建多轮轨迹。研究者分别用OpenClaw和Claude Code在ClawGym-Bench上对Qwen3-30A3B进行黑盒RL训练,Pass@1提升9.98和14.81个百分点,且200-400步优化中保持稳定。该方法在JobBench和OfficeQA等更难任务上也有持续增益,并支持混合harness联合训练。
推荐理由:这篇论文把黑盒RL搬到agent harness上,用Qwen3-30A3B在OpenClaw和Claude Code上跑,ClawGym-Bench直接涨了10到15个点,还支持多个harness一起训练。