阿里多模型入榜前端开发榜,wan3.0冲进视频榜前三
AI 大模型周榜:国产多模型扎堆入榜前端开发榜,阿里 wan3.0 冲进视频榜前三
阿里多款国产模型在细分榜单实现突破,wan3.0首次入榜即冲进视频榜前三,展现国产模型竞争力。
Arena平台2026年第36周AI大模型盲测排名显示,阿里qwen3.8-max-0902首次入榜即位列前端开发榜第4,qwen3.8-flash-next、腾讯hy4-preview、智谱glm-5.3-flash也同步首次入榜并杀入前15。阿里wan3.0首次入榜直接冲进视频榜前三,展现国产生成视频模型的最新竞争力。综合榜头部仍以海外模型为主,claude-fable-5以1507分蝉联榜首。
AI 大模型周榜:国产多模型扎堆入榜前端开发榜,阿里 wan3.0 冲进视频榜前三
IT之家 9 月 7 日消息,Arena( arena.ai )平台本周发布 2026 年第 36 周(8 月 31 日 ~9 月 6 日)AI 大模型盲测排名,本期迎来多个重量级新模型入榜,其中多款国产模型在细分榜单实现亮眼突破。 前端开发榜中, 阿里 qwen3.8-max-0902 首次入榜即位列第 4 ,阿里 qwen3.8-flash-next、腾讯 hy4-preview、智谱 glm-5.3-flash 也同步首次入榜并杀入前 15; AI 视频榜中, 阿里 wan3.0 首次入榜直接冲进前三 ,展现国产生成视频模型的最新竞争力。 整体来看,头部格局仍以海外模型为主,但国产模型在细分领域的进步速度值得关注。 IT之家注 :本榜单基于 Arena( arena.ai )平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。 综合榜 本期综合榜头部排名整体稳定,claude-fable-5 以 1507 分蝉联榜首,claude-opus-4-6-high 以 1505 分紧随其后,两者分差仅 2 分,在误差范围内视为接近。 本周有两款新模型首次入榜 ,Anthropic claude-fable-5.1-max 直接冲入前三,ELO 得分 1504 分,位列第 3;谷歌 gemini-3.8-flash-high 位列第 8,ELO 得分 1494 分,目前仍为 preliminary 阶段。 头部前 10 名分数均在 1492 分以上,分差均小于 30 分,整体竞争非常胶着。 国产模型整体处于中上游位置,梯队相对稳定: 月之暗面 kimi-k3-max 排名最高,位列第 12 名,ELO 1489 分,排名持平; 智谱 glm-5.3-max 位列第 20 名,ELO 1482 分,较上周下降 5 位; 阿里 qwen3.8-max 位列第 22 名,ELO 1480 分,排名下降 2 位; 排名 较上周 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文 1 - claude-fable-5 Anthropic 1507 ±5 27189 $10 / $50 1M 2 - claude-opus-4-6-high Anthropic 1505 ±4 72099 $5 / $25 1M 3 新上榜 claude-fable-5.1-max Anthropic 1504 ±11 2906 $10 / $50 1M 4 ↓ 1 claude-opus-4-7-high Anthropic 1502 ±4 60103 $5 / $25 1M 5 ↓ 1 muse-spark-1.2 (xHigh) Meta 1499 ±10 3240 $1.25 / $4.25 N/A 6 ↓ 1 claude-opus-4-6 Anthropic 1498 ±3 76015 $5 / $25 1M 7 ↓ 1 claude-opus-4-7 Anthropic 1494 ±4 61238 $5 / $25 1M 8 新上榜 gemini-3.8-flash-high Google 1494 ±9 5125 $0.75 / $3.75 1.05M 9 ↓ 2 claude-opus-5-high Anthropic 1493 ±5 35174 $5 / $25 1M 10 ↓ 2 muse-spark-1.1 Meta 1492 ±5 24064 $1.25 / $4.25 N/A — 以下为 Top 10 外的国产模型 — 12 ↓ 2 kimi-k3-max Moonshot 1489 ±5 18090 N/A N/A 20 ↓ 5 glm-5.3-max Z.ai 1482 ±7 7668 $1.4 / $4.4 1.05M 22 ↓ 2 qwen3.8-max Alibaba 1480 ±6 13346 $2 / $6 1M 代码榜 代码榜头部格局同样稳定,claude-opus-4-7-high 和 claude-opus-4-6-high 同以 1552 分并列前两位,claude-fable-5 以 1551 分紧随其后,前三名均为 Anthropic 模型。 本周谷歌 gemini-3.8-flash-high 首次入榜即位列第 7,ELO 1537 分;OpenAI gpt-5.5-high 也首次入榜,位列第 28,ELO 1520 分。国产模型 glm-5.3-flash 排名上升 2 位,来到第 9,表现亮眼。 国产模型在代码榜已有多款进入前 30,具体排名如下: 月之暗面 kimi-k3-max 位列第 6 名,ELO 1542 分,排名持平; 智谱 glm-5.3-flash 位列第 9 名,ELO 1534 分,较上周上升 2 位; 智谱 glm-5.3-max 位列第 16 名,ELO 1528 分,较上周下降 3 位; 阿里 qwen3.8-max 位列第 30 名,ELO 1520 分,较上周下降 4 位; 排名 较上周 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文 1 - claude-opus-4-7-high Anthropic 1552 ±6 17176 $5 / $25 1M 2 - claude-opus-4-6-high Anthropic 1552 ±6 18800 $5 / $25 1M 3 - claude-fable-5 Anthropic 1551 ±8 7293 $10 / $50 1M 4 - claude-opus-4-7 Anthropic 1547 ±6 17342 $5 / $25 1M 5 - claude-opus-4-6 Anthropic 1546 ±5 21198 $5 / $25 1M 6 - kimi-k3-max Moonshot 1542 ±9 4719 N/A N/A 7 新上榜 gemini-3.8-flash-high Google 1537 ±16 1456 $0.75 / $3.75 1.05M 8 ↑ 1 claude-opus-4-8-high Anthropic 1534 ±6 13439 $5 / $25 1M 9 ↑ 2 glm-5.3-flash Z.ai 1534 ±17 1274 $0.15 / $0.5 1.05M 10 ↓ 3 muse-spark-1.2 (xHigh) Meta 1533 ±20 935 $1.25 / $4.25 N/A — 以下为 Top 10 外的国产模型 — 16 ↓ 3 glm-5.3-max Z.ai 1528 ±14 2008 $1.4 / $4.4 1.05M 19 ↓ 1 qwen3.7-max-preview Alibaba 1525 ±18 1118 $1.48 / $4.43 1M 26 ↑ 1 mimo-v2.5-pro Xiaomi 1520 ±6 15813 $0.44 / $0.87 1.05M 30 ↓ 4 qwen3.8-max Alibaba 1520 ±10 3867 $2 / $6 1M 前端开发榜 前端开发榜本周迎来密集新模型入榜, OpenAI gpt-6-astra-max 首次登榜即拿下榜首 ,ELO 1797 分;Anthropic claude-fable-5.1-max 首次入榜位列第二,ELO 1762 分。 国产模型此次扎堆入榜表现突出, 阿里 qwen3.8-max-0902 首次入榜即冲到第 4 ,ELO 1686 分,仅次于三款海外头部模型;阿里 qwen3.8-flash-next、腾讯 hy4-preview、智谱 glm-5.3-flash 也均首次入榜并杀入前 15,分别位列第 9、第 12、第 15。 国产模型在前端开发榜已有多款进入前 20: 阿里 qwen3.8-max-0902 排名最高,位列第 4 名,ELO 1686 分,首次入榜; 月之暗面 kimi-k3-max 位列第 5 名,ELO 1674 分,排名下降 3 位; 阿里 qwen3.8-max 位列第 6 名,ELO 1670 分,排名下降 3 位; 阿里 qwen3.8-flash-next 位列第 9 名,ELO 1626 分,首次入榜; 腾讯 hy4-preview 位列第 12 名,ELO 1621 分,首次入榜。 排名 较上周 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文 1 新上榜 gpt-6-astra-max OpenAI 1797 ±24 1199 $10 / $50 1.05M 2 新上榜 claude-fable-5.1-max Anthropic 1762 ±16 2275 $10 / $50 1M 3 ↓ 2 claude-opus-5-max Anthropic 1688 ±8 10904 $5 / $25 1M 4 新上榜 qwen3.8-max-0902 Alibaba 1686 ±16 1868 $2 / $6 N/A 5 ↓ 3 kimi-k3-max Moonshot 1674 ±11 4546 $3 / $15 1.05M 6 ↓ 3 qwen3.8-max Alibaba 1670 ±12 3223 $2 / $6 1M 7 ↓ 3 claude-opus-5-high Anthropic 1661 ±7 10928 $5 / $25 1M 8 ↓ 2 claude-fable-5 Anthropic 1629 ±8 9356 $10 / $50 1M 9 新上榜 qwen3.8-flash-next Alibaba 1626 ±14 2158 $0.16 / $0.47 1M 10 ↓ 5 grok-4.6-high SpaceXAI 1625 ±11 3487 $2 / $6 500K — 以下为 Top 10 外的国产模型 — 12 新上榜 hy4-preview Tencent 1621 ±16 1661 $0.83 / $2.5 1.05M 14 ↓ 6 glm-5.3-max Z.ai 1609 ±12 2930 $1.4 / $4.4 1.05M 15 新上榜 glm-5.3-flash Z.ai 1605 ±15 1961 $0.15 / $0.5 1.05M 16 ↓ 7 qwen3.8-27b Alibaba 1594 ±11 3543 $0.4 / $3 N/A 18 ↓ 7 glm-5.2-max Z.ai 1587 ±7 9836 $1.4 / $4.4 1M 19 ↓ 7 deepseek-v4-pro-high-20260813 DeepSeek 1582 ±11 3518 $1.32 / $3.96 N/A 20 ↓ 7 deepseek-v4-flash-high DeepSeek 1580 ±10 4177 $0.44 / $1.32 1.05M 智能体榜 智能体榜本周迎来新模型 claude-fable-5.1-max 首次登榜,直接以 15.87% 的净提升度登顶榜首,原榜首 Claude Opus 5 (High) 以 12.68% 降至第二。 在信号指标方面,claude-opus-4.8 (High) 工具幻觉率仅 0.24%,为头部最低;kimi-k3-max 任务确认成功率达到 16.58%,在国产模型中领先。 国产模型在智能体榜已有多款进入前 30,其中多款新模型本周首次入榜: 月之暗面 kimi-k3-max 排名最高,位列第 7 名,净提升度 7.96%,任务确认成功率 16.58%,排名下降 1 位; 腾讯 hy4-preview 位列第 10 名,净提升度 6.92%,任务确认成功率 13.56%,首次入榜; 智谱 glm-5.2 (max) 位列第 12 名,净提升度 6.03%,较上周上升 4 位; 阿里 qwen3.8-max 位列第 16 名,净提升度 5.51%,较上周下降 5 位; 排名 较上周 模型 厂商 净提升度 (±CI) 任务确认成功率 好评 / 差评比 可控性 1 新上榜 Claude Fable 5.1 (Max) Anthropic 15.87% ±2.84% 22.45% ±3.71% 42.45% ±10.94% 0.58% ±6.77% 2 ↓ 1 Claude Opus 5 (High) Anthropic 12.68% ±1.73% 13.3% ±3.69% 18.27% ±6.49% 16.09% ±3.24% 3 ↓ 1 Claude Opus 5 (Max) Anthropic 11.67% ±1.96% 14.89% ±3.95% 17.3% ±7.1% 9.7% ±3.85% 4 ↓ 1 Claude Fable 5 (High) Anthropic 10.23% ±1.46% 7.37% ±3.17% 19.36% ±5.29% 11.89% ±2.68% 5 ↓ 1 GPT 5.6 Sol (xHigh) OpenAI 9.31% ±1.49% 6.68% ±3.13% 22.07% ±5.5% 8.88% ±2.84% 6 ↓ 1 Claude Opus 4.8 (High) Anthropic 9.17% ±1.48% 5.27% ±3.07% 18.04% ±5.19% 12.59% ±2.73% 7 ↓ 1 Kimi K3 (Max) Moonshot 7.96% ±0.68% 16.58% ±1.4% 14.03% ±2.36% 1.24% ±1.35% 8 - Claude Sonnet 5 (High) Anthropic 7.41% ±1.95% 2.8% ±4.13% 11.19% ±6.78% 11.52% ±4.13% 9 ↓ 2 GPT 5.5 (xHigh) OpenAI 7.21% ±1.08% 2.07% ±2.42% 11.41% ±3.77% 8.54% ±2.01% 10 新上榜 Hy4 preview Tencent 6.92% ±1.51% 13.56% ±2.96% 10.26% ±5.61% 0.1% ±3.21% — 以下为 Top 10 外的国产模型 — 12 ↑ 4 GLM 5.2 (Max) Z.ai 6.03% ±0.76% 8.63% ±1.64% 11.73% ±2.67% 4.48% ±1.38% 16 ↓ 5 Qwen3.8 Max Alibaba 5.51% ±1.09% 10.37% ±2.35% 6.58% ±3.8% 4.15% ±2.19% 18 ↓ 6 DeepSeek V4 Pro (High) (0813) DeepSeek 5.43% ±0.9% 11.75% ±1.91% 5.24% ±3.13% 0.67% ±1.95% 22 ↓ 2 GLM 5.3 (Max) Z.ai 3.8% ±0.71% 12.1% ±1.52% 5.75% ±2.41% 0.63% ±1.37% 23 新上榜 GLM 5.3 Flash Z.ai 3.67% ±1.03% 14.14% ±2.16% 5.45% ±3.49% 0.23% ±2.12% 24 ↓ 2 Deepseek V4 Flash (High) (20260731) DeepSeek 3.29% ±0.8% 8.46% ±1.76% 3.9% ±2.76% 0.02% ±1.6% 27 新上榜 Qwen3.8 Flash Next Alibaba 2.61% ±1.21% 12.46% ±2.49% 0.24% ±4.15% 1.18% ±2.74% 30 ↓ 3 Qwen 3.8 27B Alibaba 1.03% ±0.99% 6.98% ±2.26% 0.78% ±3.28% 0.39% ±2.02% AI 生图榜 AI 生图榜头部格局稳定,gpt-image-2 (medium) 以 1382 分蝉联榜首;微软 mai-image-2.6 首次入榜即拿到第二名,ELO 1332 分。 国产模型 seedream-5.0-pro 稳定保持第 8,qwen-image-3.0-pro 位列第 9,hunyuan-image-3.0 位列第 29,整体排名变化不大。 排名 较上周 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文 1 - gpt-image-2 (medium) OpenAI 1382 ±4 77830 $8 / $30 N/A 2 新上榜 mai-image-2.6 Microsoft AI 1332 ±7 10086 N/A N/A 3 - grok-imagine-image-2.0 (low) SpaceXAI 1315 ±12 2682 N/A N/A 4 - reve-2.1 Reve 1301 ±8 7576 N/A N/A 5 - muse-image Meta 1279 ±6 24856 N/A N/A 6 - reve-2.0 Reve 1270 ±6 14636 N/A N/A 7 - gemini-3.1-flash-image (nano-banana-2) [web-search] Google 1261 ±5 40649 $0.5 / $3 131.1K 8 - seedream-5.0-pro Bytedance 1258 ±4 59484 N/A N/A 9 - qwen-image-3.0-pro Alibaba 1254 ±7 10923 N/A N/A 10 - mai-image-2.5 Microsoft AI 1254 ±4 57295 N/A N/A — 以下为 Top 10 外的国产模型 — 16 - qwen-image-2.0-pro-2026-06-22 Alibaba 1191 ±6 12016 N/A N/A 29 - hunyuan-image-3.0 Tencent 1151 ±3 173129 N/A N/A AI 视频榜 AI 视频榜本周最大亮点是 阿里 wan3.0 首次入榜即冲进前三 ,ELO 得分 1494 分,仅次于谷歌 gemini-omni-1.1-flash( 1515 分)和 gemini-omni-flash( 1511 分),与第四名 flux-3-video( 1494 分)同分,在误差范围内视为并列。 国产 dreamina-seedance-2.5-720p 排名上升一位,来到第 6;minimax-h3 位列第 8,整体国产模型占据多个中上游位置。 排名 较上周 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文 1 - gemini-omni-1.1-flash Google 1515 ±15 1777 $1.5 / $9 131.1K 2 - gemini-omni-flash Google 1511 ±10 21934 N/A N/A 3 新上榜 wan3.0 Alibaba 1494 ±19 1167 N/A N/A 4 ↓ 1 flux-3-video Black Forest Labs 1494 ±17 1290 N/A N/A 5 新上榜 grok-imagine-video-1.5-agent SpaceXAI 1491 ±19 1195 N/A N/A 6 ↓ 1 dreamina-seedance-2.5-720p Bytedance 1482 ±12 4066 N/A N/A 7 ↓ 3 dreamina-seedance-2.0-720p Bytedance 1479 ±8 52864 N/A N/A 8 ↓ 2 minimax-h3 MiniMax 1462 ±10 7648 N/A N/A 9 ↓ 2 muse-video Meta 1456 ±15 2178 N/A N/A 10 ↓ 2 happyhorse-1.0 Alibaba-ATH 1427 ±13 22116 N/A N/A — 以下为 Top 10 外的国产模型 — 19 ↓ 4 wan2.7-t2v Alibaba 1341 ±8 23025 N/A N/A 21 ↓ 2 wan2.6-t2v Alibaba 1328 ±8 49348 N/A N/A 22 ↓ 2 seedance-v1.5-pro Bytedance 1256 ±7 75891 N/A N/A 25 ↓ 2 wan2.5-t2v-preview Alibaba 1246 ±9 32461 N/A N/A 本期 Arena 周榜的最大看点是大量新模型集中发布并迅速入榜测试, 其中国产模型在前端开发、AI 生成视频等细分领域实现了突破性排名 ,多款新模型首次入榜就冲进前十甚至前三,展现出快速迭代的竞争力。 头部综合榜仍由海外厂商模型占据,但国产模型与头部的分差正在持续缩小。 下周随着更多新模型完成投票积累,排名格局有望进一步变化,值得持续关注。