7月28日
01:10
01:10Cognition@cognition_labs
精选
Cognition 发布 FrontierCode 1.1 Extended 基准,用于评估真实工程任务的合并性与质量。Kimi K3 在该基准上取得 58.2% 的得分和 63.6% 的通过率。在 Devin 环境下,Kimi K3 在复现漏洞和环境管理方面表现突出。该结果来自 devin.ai/blog/kimi-k3。
事件专题

推荐理由:Kimi K3 在真实工程任务基准上拿了 58.2%,而且在 Devin 里特别擅长修 bug 和管理环境,值得做开发的看看。
7月15日
05:00
05:00官方一手marktechpost@Asif Razzaq
精选
文章对比了Mistral Vibe for Code、Claude Code、Cursor和Codex四个代码智能体在Scaffold-to-PR任务上的表现。评估维度涵盖成本、开源权重、自托管能力和异步代理界面。读者可以了解各智能体在相同任务下的优劣势。
事件专题

推荐理由:想知道哪个代码Agent更省钱、更开放?这篇文章把Vibe、Claude Code、Cursor和Codex拉到同一个任务上比,结果很清楚。
7月10日
5月28日