事件专题 ·多源确认

Hugging Face 把 Claude Code、Codex 等编程 harness 变成 RL 训练环境

Hugging Face 团队用捕获代理的方式,把 Claude Code、Codex、Hermes、Pi、OpenCode 等 10 个编程 harness 直接变成 RL 训练环境,harness 和训练代码都无需改动。代理支持 OpenAI Chat Completions、OpenAI Responses、Anthropic Messages、Gemini 四种格式,转发给 vLLM 并记录 token ID 和 logprobs 供 TRL 训练。在 Liquid AI 的 LFM2.5-2.6B 上测试:单 harness 训练使 OpenCode 成绩从 34% 升到 58%,4 个 harness 同时训练则全部提升(42% 到 54%),而用 Qwen3.8-27B 的 3,189 条 rollout 做 SFT 只到 47.5%。同一模型在 Mini-SWE-Agent 下得 62%,在 Claude Code 下只有 33%,说明训练环境与实际部署环境一致的重要性。另外给少用工具调用加奖励后,模型在已解决任务上的调用次数减少 31%,Codex 下约减半。

当前结论

Hugging Face 把 Claude Code、Codex 这些真实编程工具直接当 RL 训练环境用,不用改一行代码,LFM2.5-2.6B 训练后 OpenCode 成绩从 34% 涨到 58%,全套开源可复现。

11 个信源63° AI 热度最后更新 2026/10/5 14:48:22

证据链

11 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。