这周Arena盲测榜变化大,Anthropic新Claude扎堆屠榜,国产kimi-k3-max在代码和前端都紧咬前排,看看具体分数吧。
8月17日,Arena平台发布2026年第33周AI大模型盲测排名。Anthropic的claude-opus-4系列新模型密集入榜,claude-fable-5以1506分蝉联综合榜第一,claude-opus-4-6-high以1505分紧随其后。国产模型中,kimi-k3-max以1489分升至综合榜第12位,并在代码榜以1544分排名第6、前端开发榜以1674分保持第2。谷歌gemini-3.7-flash-high首次入榜即获第9名,阿里qwen3.8-max则降至第8名。榜单基于匿名盲测投票ELO分数,反映用户主观偏好。
AI 大模型周榜:Anthropic 多款新模型密集入榜,国产 kimi-k3-max 稳定头部
IT之家 8 月 17 日消息,Arena( arena.ai )平台发布 2026 年第 33 周(8 月 10 日 ~8 月 16 日)AI 大模型盲测排名,本期最大看点是 Anthropic 多款 claude-opus-4 系列新模型密集入榜并占据综合榜前五位,国产模型 kimi-k3-max 排名上升 2 位至综合榜第 12 位,在前端开发榜也保持第 2 位,qwen3.8-max 首次跻身智能体榜 Top 10。国产模型整体仍处于中上游位置,在前端开发等细分领域已经形成对头部海外模型的紧追态势。 IT之家注 :本榜单基于 Arena( arena.ai )平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。 综合榜 本期综合榜头部几乎被 Anthropic 新模型包揽,claude-fable-5 以 1506 分蝉联榜首,新入榜的 claude-opus-4-6-high 以 1505 分紧随其后位列第二,同样新入榜的 claude-opus-4-7-high 以 1502 分排名第三。前三名分数差距均在 5 分以内,属于误差范围内的并列。 谷歌 gemini-3.7-flash-high 作为新模型首次入榜即拿到第 9 名,表现亮眼。国产模型方面,kimi-k3-max 上升 2 位至第 12 名,是排名最高的国产模型。 国产模型整体处于榜单中上游,具体排名如下: 月之暗面 kimi-k3-max 位列第 12 名,ELO 1489 分,较上周上升 2 位; 阿里 qwen3.8-max 位列第 8 名,ELO 1491 分,较上周下降 2 位; 阿里 qwen3.7-max-preview 位列第 26 名,ELO 1474 分,较上周下降 3 位。 排名 较上周 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文 1 - claude-fable-5 Anthropic 1506 ±5 21533 $10 / $50 1M 2 新上榜 claude-opus-4-6-high Anthropic 1505 ±4 72516 $5 / $25 1M 3 新上榜 claude-opus-4-7-high Anthropic 1502 ±4 60331 $5 / $25 1M 4 - muse-spark-1.2 (xHigh) Meta 1498 ±10 3280 $1.25 / $4.25 N/A 5 - claude-opus-4-6 Anthropic 1497 ±3 76474 $5 / $25 1M 6 ↑ 1 claude-opus-4-7 Anthropic 1494 ±4 61419 $5 / $25 1M 7 ↑ 1 claude-opus-5-high Anthropic 1493 ±5 20030 $5 / $25 1M 8 ↓ 2 qwen3.8-max Alibaba 1491 ±8 7004 $2 / $6 1M 9 新上榜 gemini-3.7-flash-high Google 1490 ±8 5744 $0.75 / $3.57 1.05M 10 ↓ 1 claude-opus-5-max Anthropic 1489 ±7 9679 $5 / $25 1M — 以下为 Top 10 外的国产模型 — 12 ↑ 2 kimi-k3-max Moonshot 1489 ±6 11969 N/A N/A 26 ↓ 3 qwen3.7-max-preview Alibaba 1474 ±10 3717 $1.48 / $4.43 1M 代码榜 代码榜格局同样由 Anthropic 新模型主导,claude-fable-5 以 1554 分守住榜首位置,新入榜的 claude-opus-4-7-high 和 claude-opus-4-6-high 分别以 1552 分、 1551 分占据第二、第三名,分数差距极小,误差范围内视为并列。kimi-k3-max 稳定在第六名,ELO 分数上涨 2 分,依然是排名最高的国产代码模型。Meta muse-spark-1.2 (xHigh) 排名上升 7 位至第八名,是本周涨幅最大的头部模型。 国产模型在代码榜占据多个中上游席位,具体排名如下: 月之暗面 kimi-k3-max 排名最高,位列第 6 名,ELO 1544 分,排名不变; 阿里 qwen3.8-max 位列第 13 名,ELO 1529 分,较上周下降 5 位; 阿里 qwen3.7-max-preview 位列第 17 名,ELO 1525 分,排名不变; 小米 mimo-v2.5-pro 位列第 25 名,ELO 1520 分,较上周上升 3 位。 排名 较上周 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文 1 - claude-fable-5 Anthropic 1554 ±9 5817 $10 / $50 1M 2 新上榜 claude-opus-4-7-high Anthropic 1552 ±6 17272 $5 / $25 1M 3 新上榜 claude-opus-4-6-high Anthropic 1551 ±6 18894 $5 / $25 1M 4 ↑ 1 claude-opus-4-7 Anthropic 1548 ±6 17423 $5 / $25 1M 5 ↓ 1 claude-opus-4-6 Anthropic 1547 ±6 21341 $5 / $25 1M 6 - kimi-k3-max Moonshot 1544 ±11 3176 N/A N/A 7 新上榜 claude-opus-4-8-high Anthropic 1533 ±7 11417 $5 / $25 1M 8 ↑ 7 muse-spark-1.2 (xHigh) Meta 1533 ±20 947 $1.25 / $4.25 N/A 9 ↑ 2 claude-opus-5-high Anthropic 1531 ±9 5433 $5 / $25 1M 10 ↓ 1 muse-spark-1.1 Meta 1531 ±9 5002 $1.25 / $4.25 N/A — 以下为 Top 10 外的国产模型 — 13 ↓ 5 qwen3.8-max Alibaba 1529 ±13 2146 $2 / $6 1M 17 - qwen3.7-max-preview Alibaba 1525 ±18 1120 $1.48 / $4.43 1M 25 ↑ 3 mimo-v2.5-pro Xiaomi 1520 ±7 13986 $0.44 / $0.87 1.05M 前端开发榜 前端开发榜头部格局稳定,claude-opus-5-max 以 1692 分蝉联第一,国产 kimi-k3-max 以 1674 分保持第二名位置,仅落后 18 分,依然对榜首形成紧逼。阿里 qwen3.8-max 上升 1 位至第三名,ELO 分数 1667 分,深度求索的 deepseek-v4-pro-high-20260813 作为新模型首次入榜即拿到第 10 名,ELO 分数 1584 分,表现不俗。 国产模型在前端开发榜占据多个头部和中上游位置,具体如下: 月之暗面 kimi-k3-max 位列第 2 名,ELO 1674 分,排名不变; 阿里 qwen3.8-max 位列第 3 名,ELO 1667 分,较上周上升 1 位; 智谱 glm-5.2-max 位列第 9 名,ELO 1585 分,较上周下降 2 位; 深度求索 deepseek-v4-pro-high-20260813 新入榜位列第 10 名,ELO 1584 分; 深度求索 deepseek-v4-flash-high 位列第 11 名,ELO 1581 分,排名下降 3 位。 排名 较上周 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文 1 - claude-opus-5-max Anthropic 1692 ±9 6448 $5 / $25 1M 2 - kimi-k3-max Moonshot 1674 ±11 4546 $3 / $15 1.05M 3 ↑ 1 qwen3.8-max Alibaba 1667 ±13 2855 $2 / $6 1M 4 ↓ 1 claude-opus-5-high Anthropic 1663 ±9 7334 $5 / $25 1M 5 新上榜 grok-4.6-high SpaceXAI 1631 ±17 1513 $2 / $6 500K 6 ↓ 1 claude-fable-5 Anthropic 1627 ±8 7867 $10 / $50 1M 7 ↓ 1 gpt-5.6-sol-xhigh (codex-harness) OpenAI 1622 ±8 8595 $5 / $30 1.05M 8 新上榜 gemini-3.7-flash-high Google 1587 ±13 2543 $0.75 / $3.57 1.05M 9 ↓ 2 glm-5.2-max Z.ai 1585 ±8 8142 $1.4 / $4.4 1M 10 新上榜 deepseek-v4-pro-high-20260813 DeepSeek 1584 ±14 2180 N/A N/A — 以下为 Top 10 外的国产模型 — 11 ↓ 3 deepseek-v4-flash-high DeepSeek 1581 ±12 2936 $0.44 / $1.32 1.05M 24 - hy3 Tencent 1522 ±13 2284 $0.13 / $0.53 262.1K 25 ↓ 4 seed-2.1-pro-preview Bytedance 1522 ±8 7121 N/A N/A 27 ↓ 2 qwen3.7-max-20260517 Alibaba 1517 ±8 8373 $1.48 / $4.43 1M 29 ↓ 3 glm-5.1 Z.ai 1510 ±7 8817 $1.4 / $4.4 202.8K 30 ↓ 3 kimi-k2.6 Moonshot 1509 ±7 9589 $0.95 / $4 262.1K AI 生图榜 AI 生图榜中,gpt-image-2 (medium) 以 1381 分继续稳坐榜首,微软新模型 mai-image-2.6-preview 首次入榜就拿到第二名,ELO 分数 1336 分,直接跻身头部梯队。国产 seedream-5.0-pro 守住第八名,ELO 分数 1258 分,qwen-image-3.0-pro 位列第九名,两者分数差距仅 1 分,在误差范围内并列。 排名 较上周 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文 1 - gpt-image-2 (medium) OpenAI 1381 ±5 70065 N/A N/A 2 新上榜 mai-image-2.6-preview Microsoft AI 1336 ±11 3488 N/A N/A 3 ↓ 1 grok-imagine-image-2.0 (low) SpaceXAI 1316 ±12 2676 N/A N/A 4 ↓ 1 reve-2.1 Reve 1302 ±8 7588 N/A N/A 5 ↓ 1 muse-image Meta 1282 ±7 15119 N/A N/A 6 ↓ 1 reve-2.0 Reve 1270 ±6 14641 N/A N/A 7 ↓ 1 gemini-3.1-flash-image (nano-banana-2) [web-search] Google 1264 ±5 29102 N/A N/A 8 - seedream-5.0-pro Bytedance 1258 ±5 28830 N/A N/A 9 ↓ 2 qwen-image-3.0-pro Alibaba 1257 ±9 4705 N/A N/A 10 ↓ 1 mai-image-2.5 Microsoft AI 1256 ±4 46329 N/A N/A — 以下为 Top 10 外的国产模型 — 17 ↓ 1 qwen-image-2.0-pro-2026-06-22 Alibaba 1191 ±6 12021 N/A N/A 30 ↓ 1 hunyuan-image-3.0 Tencent 1151 ±3 173345 N/A N/A AI 视频榜 AI 视频榜头部迎来新变化,Black Forest Labs 新模型 flux-3-video 首次入榜即拿到第二名,ELO 分数 1496 分,仅落后榜首 gemini-omni-flash 16 分。国产模型 dreamina-seedance-2.0-720p 保持第三名位置,ELO 分数 1478 分,minimax-h3 位列第五名,整体头部格局相对稳定。 排名 较上周 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文 1 - gemini-omni-flash Google 1512 ±11 15930 N/A N/A 2 新上榜 flux-3-video Black Forest Labs 1496 ±17 1288 N/A N/A 3 ↓ 1 dreamina-seedance-2.0-720p Bytedance 1478 ±9 48355 N/A N/A 4 ↓ 1 muse-video Meta 1457 ±15 2176 N/A N/A 5 ↓ 1 minimax-h3 MiniMax 1453 ±14 2192 N/A N/A 6 ↓ 1 happyhorse-1.0 Alibaba-ATH 1428 ±13 22117 N/A N/A 7 ↓ 1 sora-2-pro OpenAI 1366 ±7 45731 $0 / $0.3 N/A 8 ↓ 1 veo-3.1-audio Google 1364 ±14 13743 $0 / $0.4 N/A 9 ↓ 1 veo-3.1-audio-1080p Google 1363 ±10 24981 N/A N/A 10 ↓ 1 veo-3.1-fast-audio Google 1362 ±10 39441 $0 / $0.15 N/A — 以下为 Top 10 外的国产模型 — 14 ↓ 1 wan2.7-t2v Alibaba 1343 ±8 16757 N/A N/A 17 ↓ 1 wan2.6-t2v Alibaba 1333 ±8 43230 N/A N/A 18 ↓ 1 seedance-v1.5-pro Bytedance 1256 ±7 76001 N/A N/A 20 ↓ 1 wan2.5-t2v-preview Alibaba 1249 ±9 27361 N/A N/A 29 ↓ 1 hailuo-2.3 MiniMax 1203 ±6 74338 N/A N/A 30 ↓ 1 hailuo-02-pro MiniMax 1198 ±12 9392 N/A N/A 智能体榜 智能体榜中,Anthropic 模型继续垄断前三,Claude Opus 5 (High) 以 12.19% 的净提升度守住榜首位置。本次榜单有两款新模型进入前十,其中国产 Qwen3.8 Max 首次入榜即排名第 11 位,净提升度达到 7.61%,任务确认成功率 12.54%,工具幻觉率仅 0.11%,表现非常亮眼。另一款新入榜的 Claude Opus 4.8 (High) 排名第六,净提升度 9.78%。国产 Kimi K3 (Max) 稳定在第五名,净提升度 10.6%,任务确认成功率 15.55%,已经跻身全球智能体第一梯队。 国产模型在智能体榜已有多款进入中上游,具体如下: 月之暗面 Kimi K3 (Max) 位列第 5 名,净提升度 10.60%,任务确认成功率 15.55%,排名不变; 阿里 Qwen3.8 Max 新入榜位列第 11 名,净提升度 7.61%,任务确认成功率 12.54%; 智谱 GLM 5.2 (Max) 位列第 14 名,净提升度 6.74%,较上周下降 2 位; 深度求索 Deepseek V4 Flash (High) (20260731) 位列第 19 名,净提升度 4.04%,较上周上升 2 位。 排名 较上周 模型 厂商 净提升度 (±CI) 任务确认成功率 好评 / 差评比 可控性 1 - Claude Opus 5 (High) Anthropic 12.19% ±1.45% 15.35% ±3.03% 19.26% ±5.29% 11.34% ±2.79% 2 - Claude Fable 5 (High) Anthropic 12.01% ±2.57% 10.66% ±4.9% 25.14% ±9.01% 8.84% ±5.23% 3 - Claude Opus 5 (Max) Anthropic 11.95% ±1.71% 17.96% ±3.18% 19.3% ±6.26% 6.95% ±3.43% 4 - GPT 5.6 Sol (xHigh) OpenAI 10.86% ±1.8% 10.12% ±3.69% 23.03% ±6.72% 9.23% ±3.74% 5 - Kimi K3 (Max) Moonshot 10.6% ±1.04% 15.55% ±2.06% 20.31% ±3.78% 7.8% ±1.91% 6 新上榜 Claude Opus 4.8 (High) Anthropic 9.78% ±1.78% 9.45% ±3.1% 22.52% ±5.71% 8.44% ±3.33% 7 - GPT 5.5 (xHigh) OpenAI 8.9% ±1.03% 4.97% ±2.18% 14.61% ±3.62% 9.17% ±1.92% 8 新上榜 Claude Opus 4.7 (High) Anthropic 8.17% ±1.43% 6.61% ±2.95% 12.32% ±4.81% 7.72% ±2.91% 9 ↑ 2 GPT 5.5 (High) OpenAI 7.73% ±0.97% 4.03% ±2.04% 11.62% ±3.39% 8.59% ±1.79% 10 - Claude Opus 4.7 Anthropic 7.66% ±1.45% 5.45% ±3.08% 11.57% ±4.71% 9.95% ±2.87% — 以下为 Top 10 外的国产模型 — 11 新上榜 Qwen3.8 Max Alibaba 7.61% ±1.6% 12.54% ±3.32% 11.64% ±5.58% 5.34% ±3.09% 14 ↓ 2 GLM 5.2 (Max) Z.ai 6.74% ±0.9% 8.39% ±1.91% 11.6% ±3.18% 6.14% ±1.58% 19 ↑ 2 Deepseek V4 Flash (High) (20260731) DeepSeek 4.04% ±0.81% 8.7% ±1.93% 2.46% ±2.71% 3.34% ±1.57% 25 ↓ 2 Kimi K2.7 Code Moonshot 1.08% ±2.15% 4.43% ±4.55% 2.74% ±7.27% 1.76% ±4.86% 26 ↓ 2 GLM 5.1 Z.ai 0.58% ±0.82% 1.75% ±1.82% 0.84% ±2.56% 1.73% ±1.48% 27 ↓ 2 Qwen3.7 Max Alibaba 0.2% ±0.87% 0.34% ±2.13% 4.24% ±2.67% 0.03% ±1.52% 28 ↓ 2 DeepSeek V4 Pro DeepSeek 0.14% ±0.88% 2.16% ±2.21% 2.5% ±2.82% 0.59% ±1.63% 本周 Arena 榜单最显著的特征是海外厂商 Anthropic 集中发布多款新模型并迅速占据各榜单头部位置,验证了其模型迭代的技术积累;国产模型方面,kimi-k3-max 在综合、代码、前端开发三个核心榜单均稳定在前 15 名,前端开发榜更是稳居第二,qwen3.8-max 在智能体榜首秀即进入 Top 11,整体来看国产大模型在通用能力和智能体领域都在持续推进,与头部海外模型的差距仍在稳步缩小。下周市场预计将有更多国产新模型完成版本迭代,值得持续关注其排名表现。