7月30日
12:15
12:15shao__meng@shao__meng
精选
Cline 团队让 Kimi K3 模型对自身运行的 Cline harness 框架进行递归式自我改进。连续运行 17 小时后,Terminal-Bench 2.1 基准从 77.5% 提升至 88.8%,同时运行成本从 $79 降至 $49.8。实验通过分析失败日志、形成假设、修复再验证的闭环迭代实现性能优化。
事件专题

推荐理由:Cline 让 Kimi K3 自己优化自己,17 小时让基准从 77.5% 涨到 88.8%,成本还降了 37%,这波自举操作有点意思。
7月22日
17:06
17:06Thomas Wolf@Thom_Wolf
Poolside AI 发布最新 agentic coding 模型 Laguna S 2.1。在 Terminal-Bench 2.1 上得分 70.2,与 5-25 倍大小的模型并列甚至领先。在 DeepSWE 基准上得分 40.4,超越部分超 1T 参数的开源模型。该模型可在单个 DGX Spark 或 Mac 上本地运行。
事件专题

推荐理由:Poolside 又出了个厉害编码模型,Laguna S 2.1 在本地就能跑,多项基准比大它几十倍的模型还强。