AI大模型周榜:Kimi K3蝉联前端开发榜全球第一

AI 大模型周榜:Kimi K3 蝉联前端开发榜全球第一、智能体榜表现突出

精选理由

这周国产Kimi K3真能打,前端开发全球第一,代码榜也杀进前十,跟Claude系列差距很小了。

AI 摘要

Arena平台发布第30周AI大模型排行,kimi-k3以ELO 1485分位列综合榜第11,蝉联前端开发榜全球第一。代码榜中kimi-k3以1530分排名第8,较上周上升2位,进入Top10。综合榜claude-fable-5以1508分蝉联榜首,Anthropic系列占据前6。国产模型中qwen3.7-max-preview排第20(ELO 1475),glm-5.2排第30(ELO 1469)。

原文 · IT之家

AI 大模型周榜:Kimi K3 蝉联前端开发榜全球第一、智能体榜表现突出

IT之家 7 月 27 日消息,Arena( arena.ai )平台今日发布了 2026 年第 30 周的 AI 大模型排行数据,统计周期为 2026-07-20 ~ 2026-07-26。 本周国产模型表现亮眼, 月之暗面旗下的 kimi-k3 蝉联前端开发榜全球第一 ,同时代码榜杀入 Top 10,成为本期最大亮点。 整体榜单中 Anthropic 旗下多款 Claude 新模型集中入榜,头部梯队集中在 1500 分区间,国产模型在多个细分赛道持续实现突破,不少模型进入对应榜单的头部序列,整体竞争力稳步提升。 综合榜 综合榜头部格局保持稳定,claude-fable-5 以 1508 分继续蝉联榜首,Anthropic 旗下多款 Claude 系列模型占据前 6 名位置,其中 claude-opus-4-6-thinking、claude-opus-4-7-thinking 等多款新模型完成入榜。 前 7 名模型的 ELO 分差均在 30 分以内,在误差范围内视为并列竞争状态。Meta 的 muse-spark-1.1 和 muse-spark 分别位列第 7 和第 8,谷歌的 gemini-3.1-pro-preview 上升 2 位来到第 9,前 10 名整体竞争十分胶着。 国产模型在综合榜中整体处于中上游位置,梯队相对完整: 月之暗面 kimi-k3 位列第 11 名,ELO 1485 分,较上周下降 2 位,是当前排名最高的国产模型; 阿里 qwen3.7-max-preview 位列第 20 名,ELO 1475 分,较上周下降 2 位; 智谱 glm-5.1 此前排名第 27,本周位列第 31 名; 智谱 glm-5.2 (max) 此前排名第 30,本周排名不变。 排名 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文 1 — 🇺🇸 claude-fable-5 Anthropic 1508 ±6 15817 $10 / $50 1M 2 — 🇺🇸 claude-opus-4-6-thinking Anthropic 1505 ±4 64435 $5 / $25 1M 3 — 🇺🇸 claude-opus-4-7-thinking Anthropic 1502 ±4 51943 $5 / $25 1M 4 — 🇺🇸 claude-opus-4-6 Anthropic 1498 ±4 68145 $5 / $25 1M 5 — 🇺🇸 claude-opus-5-high Anthropic 1495 ±8 5417 $5 / $25 1M 6 — 🇺🇸 claude-opus-4-7 Anthropic 1493 ±4 53093 $5 / $25 1M 7 — 🇺🇸 muse-spark-1.1 Meta 1493 ±7 9573 $1.25 / $4.25 N/A 8 — 🇺🇸 muse-spark Meta 1488 ±6 13497 N/A N/A 9 ↑2 🇺🇸 gemini-3.1-pro-preview 谷歌 1486 ±3 86298 $2 / $12 1.05M 10 ↓2 🇺🇸 gemini-3-pro 谷歌 1486 ±4 41242 $2 / $12 1.05M — 以下为 Top 10 外的国产模型 — 11 ↓2 🇨🇳 kimi-k3 预发布 月之暗面 1485 ±10 3569 $3 / $15 1.05M 20 ↓2 🇨🇳 qwen3.7-max-preview 阿里 1475 ±10 3698 $1.48 / $4.43 1M 30 — 🇨🇳 glm-5.2 (max) 智谱 1469 ±6 19623 $1.40 / $4.40 1M 31 ↓4 🇨🇳 glm-5.1 智谱 1469 ±5 32221 $1.40 / $4.40 202.8K 代码榜 代码榜头部依然由 Anthropic 旗下模型主导,claude-opus-4-7-thinking 以 1553 分守住榜首位置,前 5 名全部为 Anthropic Claude 系列模型,分差均在 5 分以内,竞争十分接近。 本期最大亮点是国产模型 kimi-k3 排名上升 2 位来到第 8 名 ,以 1530 分跻身代码榜 Top 10,与周边头部模型的分差也在 30 分的统计误差范围内,完全具备第一梯队的竞争力。 国产模型在代码榜中分布广泛,多个模型进入中上游序列,表现稳定: 月之暗面 kimi-k3 排名第 8 名,ELO 1530 分,较上周上升 2 位,是排名最高的国产代码模型; 阿里 qwen3.7-max-preview 排名第 15 名,ELO 1525 分,较上周下降 3 位; 智谱 glm-5.1 排名第 21 名,ELO 1520 分,较上周下降 4 位; 小米 mimo-v2.5-pro 排名第 24 名,ELO 1519 分,与上周排名相同; 月之暗面 kimi-k2.6 排名第 28 名,ELO 1515 分,较上周下降 2 位; 百度 ernie-5.1 此前排名第 27,本周来到第 31 位。 排名 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文 1 — 🇺🇸 claude-opus-4-7-thinking Anthropic 1553 ±7 14800 $5 / $25 1M 2 — 🇺🇸 claude-fable-5 Anthropic 1551 ±10 4278 $10 / $50 1M 3 ↑2 🇺🇸 claude-opus-4-6-thinking Anthropic 1550 ±6 16646 $5 / $25 1M 4 ↑1 🇺🇸 claude-opus-4-7 Anthropic 1549 ±6 15069 $5 / $25 1M 5 ↓1 🇺🇸 claude-opus-4-6 Anthropic 1548 ±6 18952 $5 / $25 1M 6 — 🇺🇸 claude-opus-5-high Anthropic 1540 ±17 1405 $5 / $25 1M 7 ↓1 🇺🇸 claude-opus-4-8-thinking Anthropic 1535 ±8 9039 $5 / $25 1M 8 ↑2 🇨🇳 kimi-k3 预发布 月之暗面 1530 ±20 948 $3 / $15 1.05M 9 ↓1 🇺🇸 muse-spark-1.1 Meta 1530 ±12 2860 $1.25 / $4.25 N/A 10 ↑1 🇺🇸 claude-opus-4-5-20251101-thinking-32k Anthropic 1530 ±7 7606 $5 / $25 200K — 以下为 Top 10 外的国产模型 — 15 ↓3 🇨🇳 qwen3.7-max-preview 阿里 1525 ±18 1113 $1.48 / $4.43 1M 21 ↓4 🇨🇳 glm-5.1 智谱 1520 ±7 9070 $1.4 / $4.4 202.8K 24 — 🇨🇳 mimo-v2.5-pro 小米 1519 ±7 11974 $0.44 / $0.87 1.05M 28 ↓2 🇨🇳 kimi-k2.6 月之暗面 1515 ±7 10342 $0.95 / $4 262.1K 31 ↓4 🇨🇳 ernie-5.1 百度 1514 ±7 10243 前端开发榜 前端开发榜迎来历史性突破,国产模型 kimi-k3 以 1682 分卫冕榜首位置(上周 1679 分),超过了此前排名第一的 claude-opus-5-high,成为全球当前前端开发能力最强的大模型。 Anthropic 的 claude-opus-5-high 以 1673 分紧随其后位列第 2,claude-fable-5 落到第 3 名,OpenAI 的 gpt-5.6-sol-xhigh 排在第 4 名。 前 4 名之外的模型分数差距开始拉开,智谱的 glm-5.2 (max) 也进入了第 5 名,继续扩大国产模型在前端开发赛道的优势。 国产模型在前端开发榜中形成了庞大的梯队,近半数席位被国产模型占据,整体表现亮眼: 月之暗面 kimi-k3 登顶榜首,ELO 1682 分,与上周排名相同,是本期榜单最大亮点; 智谱 glm-5.2 (max) 排在第 5 名,ELO 1587 分,较上周下降 1 位; 字节跳动 seed-2.1-pro-preview 排在第 15 名,ELO 1529 分,较上周下降 1 位; 智谱 glm-5.1 排在第 18 名,ELO 1518 分,较上周下降 3 位; 腾讯 hy3 排在第 19 名,ELO 1518 分; 阿里 qwen3.7-max-20260517 排在第 20 名,ELO 1517 分; 月之暗面 kimi-k2.6 排在第 21 名,ELO 1510 分,较上周下降 3 位; Minimax minimax-m3 排在第 24 名,ELO 1493 分; 阿里 qwen3.6-max-preview 排在第 28 名,ELO 1478 分; 小米 mimo-v2.5-pro 排在第 29 名,ELO 1474 分; 月之暗面 kimi-k2.7-code 排在第 30 名,ELO 1473 分。 排名 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文 1 — 🇨🇳 kimi-k3 预发布 月之暗面 1682 ±13 3776 $3 / $15 1.05M 2 — 🇺🇸 claude-opus-5-high Anthropic 1673 ±14 2392 $5 / $25 1M 3 ↓1 🇺🇸 claude-fable-5 Anthropic 1629 ±10 5721 $10 / $50 1M 4 ↓1 🇺🇸 gpt-5.6-sol-xhigh (codex-harness) OpenAI 1625 ±10 5242 $5 / $30 1.05M 5 ↓1 🇨🇳 glm-5.2 (max) 智谱 1587 ±9 5700 $1.4 / $4.4 1M 6 ↑1 🇺🇸 claude-opus-4-8-thinking Anthropic 1568 ±8 8247 $5 / $25 1M 7 ↑1 🇺🇸 claude-opus-4-7 Anthropic 1559 ±7 11050 $5 / $25 1M 8 ↑1 🇺🇸 claude-opus-4-7-thinking Anthropic 1557 ±7 11661 $5 / $25 1M 9 ↓3 🇺🇸 grok-4.5 SpaceXAI 1549 ±11 3314 $2 / $6 500K 10 ↑1 🇺🇸 claude-opus-4-6-thinking Anthropic 1546 ±6 13607 $5 / $25 1M — 以下为 Top 10 外的国产模型 — 15 ↓1 🇨🇳 seed-2.1-pro-preview 预发布 字节跳动 1529 ±10 4916 N/A N/A 18 ↓3 🇨🇳 glm-5.1 智谱 1518 ±8 6737 $1.4 / $4.4 202.8K 19 🇨🇳 hy3 腾讯 1518 ±17 1490 $0.13 / $0.53 262.1K 20 🇨🇳 qwen3.7-max-20260517 阿里 1517 ±8 7267 $1.48 / $4.43 1M 21 ↓3 🇨🇳 kimi-k2.6 月之暗面 1510 ±8 9263 $0.95 / $4 262.1K 智能体榜 智能体榜头部由 Claude Fable 5 (High) 以 12.72% 的净提升度守住榜首,该模型的可控性也达到了 14.62%,位列全榜第一。 OpenAI 的 GPT 5.6 Sol (xHigh) 以 10.12% 的净提升度紧随其后排在第 2,Anthropic 的 Claude Opus 4.8 (Thinking) 排在第 3 名。 国产模型 kimi-k3 排名第 4,净提升度 9.71%, 其任务确认成功率达到了 14.0%,是榜单所有头部模型中最高的表现 ,任务完成反馈表现突出。 国产模型在智能体榜中覆盖了从头部到中下游的大量席位,梯队十分完整: 月之暗面 kimi-k3 排名第 4 名,净提升度 9.71%,任务确认成功率 14.0%,是排名最高的国产智能体模型; 智谱 GLM 5.2 (Max) 排名第 10 名,净提升度 6.5%,任务确认成功率 8.65%; 智谱 GLM 5.1 排名第 17 名,净提升度 1.43%; 阿里 Qwen3.7 Max 排名第 19 名,净提升度 0.09%; 阿里 Qwen3.7 Plus 排名第 21 名,净提升度 0.76%,工具幻觉率仅 0.3% 为全榜最低; 月之暗面 Kimi K2.7 Code 排名第 22 名,净提升度 1.02%; 深度求索 DeepSeek V4 Pro 排名第 24 名,净提升度 1.19%; 腾讯 Hy3 排名第 25 名,净提升度 2.23%; 月之暗面 Kimi K2.6 排名第 26 名,净提升度 2.57%; Minimax Minimax M3 排名第 27 名,净提升度 3.1%; 小米 Mimo V2.5 Pro 排名第 28 名,净提升度 3.39%。 排名 模型 厂商 净提升度 (±CI) 任务确认成功率 好评 / 差评比 可控性 会话数 1 — 🇺🇸 Claude Fable 5 (High) Anthropic 12.72% ±2.0% 10.67% 23.94% 14.62% 23549 2 — 🇺🇸 GPT 5.6 Sol (xHigh) OpenAI 10.12% ±1.69% 7.25% 23.53% 9.71% 15991 3 — 🇺🇸 Claude Opus 4.8 (Thinking) Anthropic 9.75% ±1.39% 8.9% 19.42% 9.78% 34147 4 — 🇨🇳 Kimi K3 月之暗面 9.71% ±1.52% 14.0% 20.3% 6.52% 11490 5 — 🇺🇸 Claude Sonnet 5 (High) Anthropic 8.66% ±1.89% 8.14% 16.88% 6.2% 24359 6 ↓2 🇺🇸 GPT 5.5 (xHigh) OpenAI 8.41% ±0.87% 6.65% 11.08% 8.18% 40667 7 ↑1 🇺🇸 Claude Opus 4.7 (Thinking) Anthropic 7.94% ±1.24% 5.67% 11.55% 8.62% 35151 8 ↑1 🇺🇸 Claude Opus 4.7 Anthropic 7.67% ±1.25% 4.97% 12.48% 8.95% 35672 9 ↓1 🇺🇸 GPT 5.5 (High) OpenAI 7.61% ±0.81% 6.2% 9.8% 8.77% 65859 10 ↑1 🇨🇳 GLM 5.2 (Max) 智谱 6.5% ±1.0% 8.65% 12.94% 4.71% 38221 — 以下为 Top 10 外的国产模型 — 17 — 🇨🇳 GLM 5.1 智谱 1.43% ±0.78% 1.12% 0.99% 0.15% 57532 19 — 🇨🇳 Qwen3.7 Max 阿里 0.09% ±1.07% 1.84% 5.73% 0.02% 15992 AI 生图 & AI 视频榜 AI 生图榜头部格局稳定,OpenAI 的 gpt-image-2 (medium) 以 1385 分继续稳居第一,字节跳动 seedream-5.0-pro 作为排名最高的国产模型,排在第 11 名,ELO 1231 分,整体表现处于中上游位置。 AI 视频榜方面,谷歌 gemini-omni-flash 守住榜首,字节跳动 dreamina-seedance-2.0-720p 排在第 2 名,阿里 happyhorse-1.0 排在第 4 名,国产视频模型直接占据了前 4 名中的两个席位,后续字节跳动、阿里、MiniMax 的多款模型也分布在榜单中下游,形成了完整的国产视频模型梯队,竞争力处于全球第一梯队。 整体来看,本周 Arena 榜单最大的突破来自国产模型在前端开发赛道登顶, kimi-k3 同时在代码榜和智能体榜进入头部序列,体现出国产模型在工程开发、智能体实际应用场景的快速进步 。Anthropic 大量新模型集中入榜后,头部竞争的胶着程度进一步提升,后续几周的分数和排名变化值得持续关注。 下周随着更多国产新模型完成数据积累更新,有望在更多细分榜单中看到新的突破。

AI大模型周榜:Kimi K3蝉联前端开发榜全球第一 · AI 热点