AI模型精选

Kimi K3 在 FrontierCode 1.1 Extended 上得分 58.2%,通过率 63.6%

On FrontierCode 1.1 Extended, our benchmark for real-world engineering tasks that grades mergeabilit...

精选理由

Kimi K3 在真实工程任务基准上拿了 58.2%,而且在 Devin 里特别擅长修 bug 和管理环境,值得做开发的看看。

AI 摘要

Cognition 发布 FrontierCode 1.1 Extended 基准,用于评估真实工程任务的合并性与质量。Kimi K3 在该基准上取得 58.2% 的得分和 63.6% 的通过率。在 Devin 环境下,Kimi K3 在复现漏洞和环境管理方面表现突出。该结果来自 devin.ai/blog/kimi-k3。

图片来源 · Cognition
原文 · Cognition

On FrontierCode 1.1 Extended, our benchmark for real-world engineering tasks that grades mergeabilit...

On FrontierCode 1.1 Extended, our benchmark for real-world engineering tasks that grades mergeability and quality, Kimi K3 scores 58.2% with a 63.6% pass rate. Within Devin, it excels on reproducing bugs and managing its environment effectively. devin.ai/blog/kimi-k3 💬 1 🔄 1 ❤️ 22 👀 2286 📊 4 ⚡

Kimi K3 在 FrontierCode 1.1 Extended 上得分 58.2%,通过率 63.6% · AI 热点