主要来源shao__meng
查看原文事件专题 · 多源确认
Kimi K3 递归式自我改进实验:17 小时 Terminal-Bench 提升 11.3 个百分点
Cline 团队让 Kimi K3 模型对自身运行的 Cline harness 框架进行递归式自我改进。连续运行 17 小时后,Terminal-Bench 2.1 基准从 77.5% 提升至 88.8%,同时运行成本从 $79 降至 $49.8。实验通过分析失败日志、形成假设、修复再验证的闭环迭代实现性能优化。
当前结论
Cline 让 Kimi K3 自己优化自己,17 小时让基准从 77.5% 涨到 88.8%,成本还降了 37%,这波自举操作有点意思。
11 个信源58° AI 热度最后更新 2026/7/30 02:50:50
证据链
相关来源 1宝玉
查看原文相关来源 2歸藏(guizang.ai)
查看原文相关来源 3小互
查看原文相关来源 4Latent Space (swyx)
查看原文相关来源 5AI Will
查看原文相关来源 6Pandaily
查看原文相关来源 7IT之家
查看原文相关来源 8量子位
查看原文相关来源 9The Rundown AI
查看原文相关来源 10lmarena.ai
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。