产品82°

开源项目Raven实现AI自我改进

精选理由

Raven开源项目让AI能自我改进,通过管理多个Agent实现任务优化,改变了AI能力的提升方式。

Raven是一个开源项目,实现了AI自我改进(RSI)的工程化。它作为"包工头"管理多个Agent,包括4个自带Agent和13个外部Agent。通过四步流程(诊断失败、提出改进、基准测试验证、保留更好改动)实现自我优化。在nanochat预训练实验中,val_bpb降低5.8%;在溃坝流体仿真中误差降低三个数量级;连续4天完成FPS游戏及相关设计工作。

原文 · AIGCLINK

最近大家一直在谈 RSI,说白了就是 AI 自己改进自己:以前这更多是论文和访谈里的概念,最近有个开源项目Raven把它做成了能跑的工程。

Raven 自己不干活,它是"包工头":你给它一个任务,它负责拆解、派活、验收。手下有四个自带的 Agent,分别做调研、写代码、做设计、无人值守跑流程。它还能把 Claude Code、Codex、Kimi Code 等 13 家现成的 Agent 拉进来一起干,作者把它叫作 "harness of harnesses",意思是管 Agent 的 Agent。

它改的是harness的做事方法"(怎么规划、调用什么工具、记住什么、动手前检查什么),流程分四步:先诊断失败原因,再提出改法,接着拿基准测试去验证,只有比原来好的改动才会被保留。

有个关键设计,评分标准它自己改不了(这点很重要),RSI 最大的坑是 AI "给自己打高分",把考卷也改了,这个设计避免了踩这个坑。

呈现的结果如下: 1、Raven在 nanochat 预训练实验里,7 轮跑了 172 次训练,一次没崩,同样是单卡 20 分钟的预算,val_bpb 降了 5.8%,也就是 AI 自己把训 AI 的方法调得更好了 2、在溃坝流体仿真里,把误差压低了三个数量级 3、连续约 4 天、42 轮,独立做完一个 FPS 游戏,外加海报、PPT 和官网

对AI圈、技术圈、商业的影响如下:

一、对 AI 圈:提升能力的杠杆从模型转移到harness

过去提升能力主要靠训更大的模型,现在出现了第二条路:模型不变,让外面那层"做事方法"自己进化,这意味着 harness 工程会成为一门独立的手艺。

更深一层的变化是,评测会变成最核心的资产:AI 能自己改进以后,往哪个方向改,完全由评测决定,谁定义了评测,谁就掌握了进化方向。

二、对应用圈:护城河在验收标准

以前做 Agent 应用,壁垒是提示词和工作流,这些东西以后 AI 能自己调、自己优化,壁垒会变薄。

真正的壁垒会搬到三样东西上: .行业里的验收标准,也就是"什么叫做对了" .长期记忆 .真实场景里的数据反馈

开发者的工作也会从"写流程"变成"写验收标准",垂直行业的 know-how 反而更值钱了,因为只有懂行的人才定义得出"什么叫好"。

三、对商业:谁当包工头,谁拿分配权

当一个调度层能同时指挥 Claude Code、Codex、Kimi 干活的时候,底下的模型和 Agent 就变成了"分包商",可以随时替换。价值会往两头集中:一头是入口和调度,另一头是对结果负责的交付。

收费模式也会跟着变:从按席位、按 token 收钱,走向按结果收钱,企业买的不再是一个工具,而是一个能交付、可审计、改动前经过验证的 AI 员工。

RSI 目前改的是 harness 而不是模型权重,离"AI 自己造出更强的 AI"还有距离,但方向已经很清楚,值得 AI 从业者认真看一眼。