Cline 让 Kimi K3 自己优化自己,17 小时让基准从 77.5% 涨到 88.8%,成本还降了 37%,这波自举操作有点意思。
Cline 团队让 Kimi K3 模型对自身运行的 Cline harness 框架进行递归式自我改进。连续运行 17 小时后,Terminal-Bench 2.1 基准从 77.5% 提升至 88.8%,同时运行成本从 $79 降至 $49.8。实验通过分析失败日志、形成假设、修复再验证的闭环迭代实现性能优化。
Cline 团队让 Kimi K3 做了一次「递归式自我改进」实验,让 K3 优化自己运行的框架「Cline harness」 连续运行 17 小时后,Terminal-Bench 2.1 基准从 ...
Cline 团队让 Kimi K3 做了一次「递归式自我改进」实验,让 K3 优化自己运行的框架「Cline harness」 连续运行 17 小时后,Terminal-Bench 2.1 基准从 77.5% 提升到 88.8%,成本也从 $79 下降到了 $49.8 我对「递归式自我改进(Recursive Self Improvement)」这个标题还是有些疑问,有些唬人! 相比于 Coding Agent 直接帮我们在项目中改代码,这个实验更进一步的点是「闭环」,从分析失败日志 → 形成假设 → 修复 → 验证的迭代循环。 Kimi K3 运行在 Cline harness 之下,对要实现哪些目标很确定、中间产生了哪些行为和数据也很清楚,就会有更完整的记录到修复的循环依据。 对我们用 Coding Agent 做产品优化确实也有启发,就是不能只看代码、只跑单测,让 Agent 进入正常运行循环中,接收到更明确的目标,更有利于搞定任务。 Cline @cline We had Kimi K3 recursively self-improve the Cline harness to improve its own performance. 17 hours later, it went from 77.5% to 88.8% on Terminal Bench, and cut run cost from $79 to $49.8. 🔗 View Quoted Tweet 💬 0 🔄 0 ❤️ 0 👀 335 ⚡