这周榜单有意思:阿里qwen3.8-max追平Claude,Meta新模型第4,kimi代码第6,信息量足。
Arena平台发布2026年第32周AI大模型盲测排名,综合榜前10名ELO均在1488分以上。阿里qwen3.8-max以1497分位列第6,与claude-opus-4-6同分;Meta muse-spark-1.2 (xHigh)首秀以1498分排第4。代码榜上月之暗面kimi-k3-max升至第6,ELO 1542分;阿里qwen3.8-max排第8,ELO 1532分。Anthropic claude-fable-5在综合榜和代码榜均居榜首。
AI 大模型周榜:阿里 qwen3.8-max 冲进综合榜 Top 6,国产多模型表现亮眼
IT之家 8 月 10 日消息,Arena( arena.ai )平台发布 2026 年第 32 周(8 月 3 日 ~8 月 9 日)AI 大模型盲测排名,本周共有多款新模型入榜,其中国产模型阿里 qwen3.8-max 表现突出,杀入综合榜第 6 名,ELO 分数达到 1497 分,整体处于头部梯队。Meta 全新推出的 muse-spark-1.2 (xHigh) 也位列综合榜第 4 名,成为海外阵营的亮眼新秀。本周多个细分榜单都有新模型亮相,国产模型在前端开发、代码、生图等领域均实现突破。 IT之家注 :本榜单基于 Arena( arena.ai )平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。 综合榜 本周综合榜头部格局相对稳定,Anthropic 旗下 claude-fable-5 依旧占据榜首位置,ELO 分数为 1507 分,claude-opus-4-6-thinking、claude-opus-4-7-thinking 紧随其后位列第二、三名,三者分差均在 10 分以内,在误差范围内视为接近。本周最大看点是两款新模型强势闯入头部:Meta 新发布的 muse-spark-1.2 (xHigh) 首秀排名第 4,ELO 1498 分;阿里全新 qwen3.8-max 拿到第 6 名,ELO 1497 分,与第 5 名的 claude-opus-4-6 同分,仅因置信区间差异排名靠后,同样在统计误差范围内并列。头部整体分数密集,前 10 名分数均在 1488 分以上,竞争极为激烈。 国产模型在综合榜已有多款进入中上游,具体排名如下: 阿里 qwen3.8-max 排名第 6 名,ELO 1497 分; 月之暗面 kimi-k3-max 排名第 14 名,ELO 1485 分,排名持平; 阿里 qwen3.7-max-preview 排名第 23 名,ELO 1475 分,排名下降 2 位。 排名 较上周 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文 1 - claude-fable-5 Anthropic 1507 ±6 19390 $10 / $50 1M 2 - claude-opus-4-6-thinking Anthropic 1505 ±4 69336 $2.5 / $12.5 1M 3 - claude-opus-4-7-thinking Anthropic 1502 ±4 57018 $5 / $25 1M 4 新上榜 muse-spark-1.2 (xHigh) Meta 1498 ±13 2057 $1.25 / $4.25 N/A 5 ↓ 1 claude-opus-4-6 Anthropic 1497 ±3 73158 $2.5 / $12.5 1M 6 新上榜 qwen3.8-max Alibaba 1497 ±9 4662 $2 / $6 1M 7 ↓ 2 claude-opus-4-7 Anthropic 1493 ±4 58135 $5 / $25 1M 8 ↓ 2 claude-opus-5-high Anthropic 1493 ±6 14902 $5 / $25 1M 9 ↓ 2 claude-opus-5-max Anthropic 1488 ±8 7137 $5 / $25 1M 10 ↓ 1 muse-spark Meta 1488 ±6 13476 N/A N/A — 以下为 Top 10 外的国产模型 — 14 ↓ 2 kimi-k3-max Moonshot 1485 ±7 9861 N/A N/A 23 ↓ 2 qwen3.7-max-preview Alibaba 1475 ±10 3695 $1.48 / $4.43 1M 代码榜 代码榜头部依旧被 Anthropic 模型垄断,claude-fable-5 蝉联第一,ELO 1553 分,claude-opus-4-7-thinking、claude-opus-4-6-thinking 分别占据第二、三名。月之暗面 kimi-k3-max 本周排名从第 8 位上升至第 6 位,ELO 分数上涨 11 分至 1542 分,闯入 Top 6,成为代码榜排名最高的国产模型。阿里 qwen3.8-max 排名第 8,ELO 1532 分,同样进入前十。Meta muse-spark-1.2 (xHigh) 本周首次入榜排名第 15,ELO 1526 分。 国产模型在代码榜已有多款进入前 30,具体如下: 月之暗面 kimi-k3-max 排名第 6 名,ELO 1542 分,较上周上升 2 位; 阿里 qwen3.8-max 排名第 8 名,ELO 1532 分; 阿里 qwen3.7-max-preview 排名第 17 名,ELO 1526 分,排名下滑 1 位; 小米 mimo-v2.5-pro 排名第 28 名,ELO 1519 分,排名持平; 智谱 glm-5.1 排名第 30 名,ELO 1517 分,较上周下降 3 位。 排名 较上周 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文 1 - claude-fable-5 Anthropic 1553 ±9 5234 $10 / $50 1M 2 - claude-opus-4-7-thinking Anthropic 1552 ±6 16303 $5 / $25 1M 3 - claude-opus-4-6-thinking Anthropic 1551 ±6 18015 $2.5 / $12.5 1M 4 - claude-opus-4-6 Anthropic 1547 ±6 20444 $2.5 / $12.5 1M 5 - claude-opus-4-7 Anthropic 1546 ±6 16534 $5 / $25 1M 6 ↑ 2 kimi-k3-max Moonshot 1542 ±12 2611 N/A N/A 7 ↓ 1 claude-opus-4-8-thinking Anthropic 1535 ±7 10509 $2.5 / $12.5 1M 8 新上榜 qwen3.8-max Alibaba 1532 ±16 1411 $2 / $6 1M 9 ↑ 1 muse-spark-1.1 Meta 1532 ±10 4199 $1.25 / $4.25 N/A 10 ↓ 1 claude-opus-4-5-20251101- thinking-32k Anthropic 1530 ±7 7603 $5 / $25 200K — 以下为 Top 10 外的国产模型 — 17 ↓ 1 qwen3.7-max-preview Alibaba 1526 ±18 1112 $1.48 / $4.43 1M 28 - mimo-v2.5-pro Xiaomi 1519 ±7 13199 $0.44 / $0.87 1.05M 30 ↓ 3 glm-5.1 Z.ai 1517 ±7 10330 $1.4 / $4.4 202.8K 前端开发榜 本周前端开发榜榜首依旧是 claude-opus-5-max,ELO 1686 分,月之暗面 kimi-k3-max 稳定保持第二位,ELO 1675 分,仅下跌 1 分,仍紧逼头部海外模型。阿里 qwen3.8-max 拿下第四名,ELO 1667 分,直接进入前五,表现十分抢眼。深度求索 deepseek-v4-flash-high 也首次入榜,排名第 8 位,ELO 1581 分。国产模型在前端开发榜已经占据多个 top10 位置,整体竞争力持续提升。 国产模型具体排名如下: 月之暗面 kimi-k3-max 排名第 2 名,ELO 1675 分,排名持平; 阿里 qwen3.8-max 排名第 4 名,ELO 1667 分; 智谱 glm-5.2-max 排名第 7 名,ELO 1588 分,上升 1 位; 深度求索 deepseek-v4-flash-high 排名第 8 名,ELO 1581 分,首次入榜。 排名 较上周 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文 1 - claude-opus-5-max Anthropic 1686 ±11 4029 $5 / $25 1M 2 - kimi-k3-max Moonshot 1675 ±12 4372 $3 / $15 1.05M 3 - claude-opus-5-high Anthropic 1670 ±10 5145 $5 / $25 1M 4 新上榜 qwen3.8-max Alibaba 1667 ±16 1980 $2 / $6 1M 5 ↓ 1 claude-fable-5 Anthropic 1630 ±9 6816 $10 / $50 1M 6 ↓ 1 gpt-5.6-sol-xhigh (codex-harness) OpenAI 1620 ±9 6903 $5 / $30 1.05M 7 ↓ 1 glm-5.2-max Z.ai 1588 ±9 6924 $1.4 / $4.4 1M 8 新上榜 deepseek-v4-flash-high DeepSeek 1581 ±15 1931 $0.14 / $0.28 1.05M 9 ↓ 1 claude-opus-4-8-thinking Anthropic 1565 ±8 9549 $2.5 / $12.5 1M 10 ↓ 1 claude-opus-4-7 Anthropic 1560 ±7 12398 $5 / $25 1M — 以下为 Top 10 外的国产模型 — 21 ↓ 3 seed-2.1-pro-preview Bytedance 1524 ±9 6069 N/A N/A 24 ↓ 1 hy3 Tencent 1522 ±15 1729 $0.13 / $0.53 262.1K 25 ↓ 3 qwen3.7-max-20260517 Alibaba 1516 ±8 8044 $1.48 / $4.43 1M 26 ↓ 2 glm-5.1 Z.ai 1515 ±8 7853 $1.4 / $4.4 202.8K 27 ↓ 2 kimi-k2.6 Moonshot 1510 ±8 9261 $0.95 / $4 262.1K 智能体榜 智能体榜本周头部发生更替,Anthropic Claude Opus 5 (High) 从第三名上升至第一名,净提升度达到 11.99%,此前榜首 Claude Fable 5 (High) 降至第二,净提升度 11.66%,两者净提升度差距小于双方置信区间之和,在误差范围内视为并列。国产模型月之暗面 Kimi K3 (Max) 稳定保持第五名,净提升度 10.08%,任务确认成功率达到 14.97%,已经跻身智能体榜第一梯队。深度求索 Deepseek V4 Flash (High) (20260731) 本周首次入榜排名第 21,净提升度 2.84%,任务确认成功率达到 8.53%,首秀表现符合预期。 国产模型在智能体榜已有多款进入前 30,具体如下: 月之暗面 Kimi K3 (Max) 排名第 5 名,净提升度 10.08%,任务确认成功率 14.97%,排名持平; 智谱 GLM 5.2 (Max) 排名第 12 名,净提升度 6.75%,排名持平; 深度求索 Deepseek V4 Flash (High) (20260731) 排名第 21 名,净提升度 2.84%,首次入榜; 智谱 GLM 5.1 排名第 24 名,净提升度 0.35%,排名下降 2 位。 排名 较上周 模型 厂商 净提升度 (±CI) 任务确认成功率 好评 / 差评比 可控性 1 ↑ 2 Claude Opus 5 (High) Anthropic 11.99% ±1.37% 16.04% ±2.79% 19.46% ±5.19% 10.29% ±2.51% 2 ↓ 1 Claude Fable 5 (High) Anthropic 11.66% ±2.39% 11.47% ±4.46% 22.56% ±8.25% 10.01% ±4.93% 3 ↓ 1 Claude Opus 5 (Max) Anthropic 11.19% ±1.62% 16.36% ±3.11% 19.07% ±6.03% 5.8% ±3.1% 4 - GPT 5.6 Sol (xHigh) OpenAI 10.28% ±1.72% 9.06% ±3.48% 22.7% ±6.42% 8.42% ±3.5% 5 - Kimi K3 (Max) Moonshot 10.08% ±1.07% 14.97% ±2.09% 19.68% ±3.85% 7.45% ±1.97% 6 - Claude Opus 4.8 (Thinking) Anthropic 9.35% ±1.7% 8.81% ±2.9% 21.46% ±5.38% 8.5% ±3.08% 7 ↑ 1 GPT 5.5 (xHigh) OpenAI 8.45% ±0.99% 5.24% ±2.08% 13.56% ±3.55% 8.19% ±1.8% 8 ↑ 1 Claude Opus 4.7 (Thinking) Anthropic 8.33% ±1.32% 6.65% ±2.76% 11.87% ±4.59% 8.61% ±2.72% 9 ↓ 2 Claude Sonnet 5 (High) Anthropic 7.46% ±2.15% 5.56% ±4.29% 14.8% ±7.65% 5.14% ±4.55% 10 ↑ 1 Claude Opus 4.7 Anthropic 7.32% ±1.36% 5.55% ±2.85% 10.72% ±4.45% 9.54% ±2.7% — 以下为 Top 10 外的国产模型 — 12 - GLM 5.2 (Max) Z.ai 6.75% ±0.9% 9.21% ±1.83% 12.39% ±3.21% 5.62% ±1.59% 21 新上榜 Deepseek V4 Flash (High) (20260731) DeepSeek 2.84% ±1.1% 8.53% ±2.54% 0.46% ±3.64% 0.43% ±2.19% 23 - Kimi K2.7 Code Moonshot 0.69% ±1.94% 4.12% ±4.08% 2.36% ±6.68% 1.92% ±4.37% 24 ↓ 2 GLM 5.1 Z.ai 0.35% ±0.77% 1.06% ±1.72% 0.72% ±2.5% 0.76% ±1.4% 25 - Qwen3.7 Max Alibaba 0.16% ±0.88% 0.24% ±2.11% 5.07% ±2.72% 0.21% ±1.55% 26 - DeepSeek V4 Pro DeepSeek 0.33% ±0.86% 2.74% ±2.16% 3.35% ±2.78% 0.3% ±1.54% 27 ↑ 2 Kimi K2.6 Moonshot 0.48% ±2.16% 2.28% ±4.11% 2.12% ±6.8% 1.66% ±4.49% 30 ↓ 3 Hy3 Tencent 1.12% ±1.42% 2.2% ±3.04% 3.7% ±4.91% 9.01% ±2.6% AI 生图榜 本周 AI 生图榜头部依旧是 OpenAI gpt-image-2 (medium) 占据第一,ELO 1380 分,SpaceXAI 新推出的 grok-imagine-image-2.0 (low) 首次入榜即拿到第二名,ELO 1320 分,表现出色。国产方面,阿里 qwen-image-3.0-pro 首次入榜排名第七,ELO 1258 分,字节跳动 seedream-5.0-pro 排名第八,ELO 1257 分,两款国产模型均进入前十,整体处于第一梯队。腾讯 hunyuan-image-3.0 排名第 29 名,ELO 1151 分,表现稳定。 排名 较上周 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文 1 - gpt-image-2 (medium) OpenAI 1380 ±5 69194 N/A N/A 2 新上榜 grok-imagine-image-2.0 (low) SpaceXAI 1320 ±12 2722 N/A N/A 3 ↓ 1 reve-2.1 Reve 1302 ±8 7598 N/A N/A 4 ↓ 1 muse-image Meta 1283 ±7 14510 N/A N/A 5 ↓ 1 reve-2.0 Reve 1270 ±6 14650 N/A N/A 6 ↓ 1 gemini-3.1-flash-image (nano-banana-2) [web-search] Google 1263 ±5 27910 N/A N/A 7 新上榜 qwen-image-3.0-pro Alibaba 1258 ±10 3735 N/A N/A 8 ↓ 2 seedream-5.0-pro Bytedance 1257 ±5 26510 N/A N/A 9 ↓ 2 mai-image-2.5 Microsoft AI 1256 ±5 44940 N/A N/A 10 ↓ 2 gemini-3.1-flash-lite-image (nano-banana-2-lite) Google 1251 ±6 16419 N/A N/A — 以下为 Top 10 外的国产模型 — 16 ↓ 2 qwen-image-2.0-pro-2026-06-22 Alibaba 1191 ±6 12026 N/A N/A 29 ↓ 4 hunyuan-image-3.0 Tencent 1151 ±3 173366 N/A N/A AI 视频榜 AI 视频榜头部格局稳定,谷歌 gemini-omni-flash 依旧占据榜首,ELO 1513 分,字节跳动 dreamina-seedance-2.0-720p 保持第二名,ELO 1479 分,差距仅 34 分,接近头部水平。MiniMax 全新 minimax-h3 首次入榜排名第四,ELO 1455 分,直接闯入前五,成为国产 AI 视频模型的最新亮点。阿里 happyhorse-1.0 排名第五,ELO 1428 分,同样保持稳定,国产模型已经占据榜单前五中的三个席位,优势明显。 排名 较上周 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文 1 - gemini-omni-flash Google 1513 ±12 14571 N/A N/A 2 - dreamina-seedance-2.0-720p Bytedance 1479 ±11 47067 N/A N/A 3 - muse-video Meta 1458 ±15 2160 N/A N/A 4 新上榜 minimax-h3 MiniMax 1455 ±19 1060 N/A N/A 5 ↓ 1 happyhorse-1.0 Alibaba-ATH 1428 ±13 21979 N/A N/A 6 ↓ 1 sora-2-pro OpenAI 1365 ±8 44543 $0 / $0.3 N/A 7 - veo-3.1-audio Google 1364 ±14 13687 $0 / $0.4 N/A 8 ↓ 2 veo-3.1-audio-1080p Google 1363 ±10 24846 N/A N/A 9 ↓ 1 veo-3.1-fast-audio Google 1362 ±11 39301 $0 / $0.15 N/A 10 ↓ 1 veo-3.1-fast-audio-1080p Google 1358 ±10 25637 N/A N/A — 以下为 Top 10 外的国产模型 — 13 ↓ 2 wan2.7-t2v Alibaba 1347 ±9 15246 N/A N/A 16 ↓ 1 wan2.6-t2v Alibaba 1330 ±9 41706 N/A N/A 17 ↓ 1 seedance-v1.5-pro Bytedance 1256 ±7 75653 N/A N/A 19 ↓ 2 wan2.5-t2v-preview Alibaba 1252 ±10 25895 N/A N/A 28 ↓ 1 hailuo-2.3 MiniMax 1202 ±7 72127 N/A N/A 29 ↓ 1 hailuo-02-pro MiniMax 1198 ±13 9365 N/A N/A 30 ↓ 1 seedance-v1-pro Bytedance 1190 ±11 12117 N/A N/A 本周 Arena 周榜迎来多款重量级新模型,国产大模型在综合、代码、前端开发、生图、视频等多个维度均实现突破,阿里 qwen3.8-max 首秀即杀入头部梯队,证明国产大模型综合能力已经接近国际第一梯队水平,多个细分领域国产模型已经占据领先位置。下周预计将有更多新模型完成测试入榜,我们也将持续关注排名变化。