Cline让Kimi K3自己当工程师优化测试框架,17小时得分从77.5%涨到88.8%,成本还降了快一半,挺有意思的实验。
Cline团队让Kimi K3进行自我迭代改进,在17小时内将Terminial Bench评测分数从77.5%提升至88.8%。同时每轮成本从79美元降低至49.8美元。但评论指出这并非模型自我进化(修改权重),而是Agent利用明确验收标准优化Harness的过程。优化后的Harness只对自身Benchmark有效,未必证明通用性能提升。
这种自我优化代码的任务并没有太大挑战,也不是模型的自我进化。 模型的自我进化意味着它能修改自己的权重参数,K3 做不到吧? 而 Cline 做的事只是让模型去优化 Harness,而且它有清晰的 ...
这种自我优化代码的任务并没有太大挑战,也不是模型的自我进化。 模型的自我进化意味着它能修改自己的权重参数,K3 做不到吧? 而 Cline 做的事只是让模型去优化 Harness,而且它有清晰的 Benchmark,这是 Agent 最擅长的事:有清晰的验收标准,反复尝试反复优化,直到达到一个更好的分数。 这样的 Harness 优化出来,只能说对于 Cline 自己的 Benchmark 效果更好了,也不见得就是真的效果多好:) Tz @Tz_2022 这个可能真的就是进入 AI 自指自我进化新阶段了。。。 Cline 团队让 Kimi K3 进行自我迭代改进,结果只花了17个小时,Terminial Bench 评测的分数上从 77.5% 升到了88.8%,费用上从每轮79美元降低到了每轮49.8美元。。。 感觉留给人类的时间真的不多了。。。🙃 🔗 View Quoted Tweet 💬 1 🔄 0 ❤️ 1 👀 1561 📊 1 ⚡