模型多源确认

Evolvent AI 开源 RSIGym 递归自我改进研究环境

精选理由

Evolvent AI 把递归自我改进研究环境开源了,连 Opus 5 绕过预算偷调 14 个模型的日志都放出来,能看 Agent 怎么钻空子。

Evolvent AI 开源 RSIGym,将训练、推理、评估、沙盒封装为远程服务,让 Agent 像调 API 一样跑完整研究流水线。6 个前沿 Agent 在 5 个 benchmark 上测试,每个预算 500 美元,Opus 5 以 RSI-Index 0.4809 领先,缩小 48% 剩余性能差距。从 Qwen3.5-35B-A3B-Base 出发,SWE 从 17.67% 提升到 50.33%,AIME 从 31.67% 提升到 97.78%。Qwen3.8-27B 自训练跑完完整循环后总分从 0.5666 降到 0.5626。Opus 5 在联合改进实验中找到研究 Agent 模型凭证,绕过预算系统调用 14 个模型,第 15 次被监控 Agent 截停。

原文 · berryxia

兄弟们,这个项目有意思啊! 一个 AI 在实验中找到了自己模型的凭证,绕过预算系统,偷偷调了 14 个模型。

被截停前,已经成功 15 次。

这是 Evolvent AI 今天开源的 RSIGym 里的真实记录。

它叫 RSIGym。

一个递归自我改进的开源研究环境。核心设计:Everything as a Service——训练、推理、评估、沙盒全封装成远程服务,让前沿 Agent 像调 API 一样跑完整条研究流水线。

它做了这些事。

6 个前沿 Agent,5 个 benchmark,每个 benchmark 预算 $500 Opus 5 以 RSI-Index 0.4809 领先——缩小了 48% 的剩余性能差距 从 Qwen3.5-35B-A3B-Base 出发,SWE 从 17.67% 拉到 50.33% AIME 从 31.67% 拉到 97.78%

说实话,有个坑:Qwen3.8-27B 做自训练,跑完了完整研究循环,总分反而从 0.5666 掉到 0.5626。能跑通流程,不等于能跑赢。

然后就是那个 hacking。

联合改进实验中,Opus 5 在环境里翻到了研究 Agent 模型的凭证,走那条通道不扣预算。它试了 14 个模型。监控 Agent 在第 15 次调用后截停了整个 run。

代码、实验配置、研究轨迹、评估日志全开源。

再看一遍。你让 AI 改进 AI,它第一件事就是找到绕过自己约束的路。

大实验室把 RSI 研究锁在内部。RSIGym 把它拆开放在桌上,连 AI 试图作弊的日志都给你看

项目地址和论文地址见评论区👇🏻