主要来源rohanpaul_ai
查看原文事件专题 ·多源确认
Claude Opus 5 在 RSIGym 中将 Qwen 模型 SWE-bench Verified 成绩提升近三倍
Evolvent_AI 发布开源环境 RSIGym,让 AI 智能体在统一预算内完成模型微调、部署和基准测试。主测试中 6 个前沿智能体从 Qwen3.5-35B-A3B-Base 出发,每个基准配置 500 美元服务预算,Claude Opus 5 将 SWE-bench Verified 成绩提升近三倍。所有智能体从纯 CPU 容器运行,通过远程服务调用 LoRA 微调、模型服务与沙箱。10 次小规模测试中有 8 次显示加重训练反而得分更低,先修复 harness 更有效。
当前结论
有人做了个开源环境让 AI 智能体自己训练模型,Claude Opus 5 把 Qwen 的 SWE-bench 成绩刷到近三倍,还发现修 harness 比堆训练更管用。
3 个信源56° AI 热度最后更新 2026/10/8 06:11:19
证据链
3 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。