这期榜单告诉你哪家模型综合最强、代码最好、数学最牛。国产的qwen3.7-max-preview在代码榜进了前十,值得看看。
Arena平台公布6月29日~7月5日大模型对战综合榜,Anthropic的claude-fable-5以1509 ELO分蝉联第一,领先第二名claude-opus-4-6-thinking仅5分。前十名全部为美国厂商,gemini-3.5-flash上升2位至第11名,glm-5.1下滑3位至第22名。国产模型中,阿里qwen3.7-max-preview以1475分排名第15,百度ernie-5.1以1468分排第27,小米mimo-v2.5-pro以1466分列第29。代码榜中Anthropic垄断前九,claude-fable-5得1563分居首,国产qwen3.7-max-preview位列第10。数学榜由claude-opus-4-6-thinking以1518分领跑,国产kimi-k2.6排名第13。
AI 大模型周榜:claude-fable-5 蝉联榜首,国产模型稳定中上游
IT之家 7 月 9 日消息,Arena( arena.ai )平台公布了最新一期大模型对战周榜,本期统计覆盖 2026 年 6 月 29 日 ~7 月 5 日。 本周榜首位置依旧由 🇺🇸 Anthropic 的 claude-fable-5 牢牢占据 ,分数微涨 1 分,美国厂商在头部占据绝对优势,国产模型整体保持稳定,多款模型跻身前 30 行列。 IT之家附各主要领域榜单如下: 综合榜 本期综合榜整体格局变动不大,头部前 5 名均为 🇺🇸 Anthropic 旗下 Claude 系列模型,彼此之间 ELO 分差在 15 分以内,处于统计误差范围内,视为第一梯队。 前十名全部被美国厂商包揽,排名变动基本在 1~2 位,仅 🇺🇸 gemini-3.5-flash 上升 2 位至第 11 名,是前十名外排名提升最多的模型; 🇺🇸 glm-5.1 下滑 3 位至第 22 名,排名变动相对明显。 国产模型整体处于中上游位置 ,梯队相对稳定: 阿里 qwen3.7-max-preview 排名最高,位列第 15 名,ELO 1475 分,较上周上升 1 位; 百度 ernie-5.1 位列第 27 名,ELO 1468 分,排名持平; 小米 mimo-v2.5-pro 位列第 29 名,ELO 1466 分,排名持平。 排名 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文 1 🇺🇸 claude-fable-5 Anthropic 1509 ±9 4350 $10 / $50 1M 2 🇺🇸 claude-opus-4-6-thinking Anthropic 1504 ±4 55102 $5 / $25 1M 3 🇺🇸 claude-opus-4-7-thinking Anthropic 1502 ±4 41868 $5 / $25 1M 4 🇺🇸 claude-opus-4-6 Anthropic 1499 ±4 58565 $5 / $25 1M 5 🇺🇸 claude-opus-4-7 Anthropic 1494 ±4 43053 $5 / $25 1M 6 🇺🇸 muse-spark Meta 1487 ±6 13591 N/A N/A 7 🇺🇸 gemini-3.1-pro-preview 谷歌 1486 ±4 73099 $2 / $12 1.05M 8 🇺🇸 gemini-3-pro 谷歌 1486 ±4 41306 $2 / $12 1.05M 9 🇺🇸 claude-opus-4-8-thinking Anthropic 1484 ±5 22340 $5 / $25 1M 10 🇺🇸 gpt-5.5-high OpenAI 1481 ±5 37260 $5 / $30 1.05M — 以下为 Top 10 外的国产模型 — 15 ↑1 🇨🇳 qwen3.7-max-preview 预发布 阿里 1475 ±10 3727 $1.25 / $3.75 1M 27 — 🇨🇳 ernie-5.1 百度 1468 ±5 32742 N/A N/A 29 — 🇨🇳 mimo-v2.5-pro 小米 1466 ±5 34468 $0.44 / $0.87 1.05M 代码榜 代码榜依然被 🇺🇸 Anthropic 垄断前九席位,头部排名没有变化,🇺🇸 claude-fable-5 以 1563 分稳居第一,领先第二名 🇺🇸 claude-opus-4-7-thinking 仅 10 分,分差在误差范围内。 排名变动较大的是 🇺🇸 glm-5.2 (max),从第 13 位大跌 8 位至第 21 位,ELO 分下降 10 分; 🇺🇸 gemini-3.5-flash 在创意写作榜提升 4 位,但代码榜无明显变动,国产 🇨🇳 qwen3.7-plus 排名上升 2 位进入前 30。 国产模型在代码榜表现亮眼 ,已有多款进入前 30: 阿里 qwen3.7-max-preview 位列第 10 名,ELO 1526 分,排名持平; 小米 mimo-v2.5-pro 位列第 17 名,ELO 1520 分,较上周上升 1 位; 月之暗面 kimi-k2.6 位列第 28 名,ELO 1512 分,排名持平; 百度 ernie-5.1 位列第 29 名,ELO 1512 分,较上周下降 2 位; 阿里 qwen3.7-plus 位列第 30 名,ELO 1512 分,较上周上升 2 位。 排名 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文 1 🇺🇸 claude-fable-5 Anthropic 1563 ±18 1123 $10 / $50 1M 2 🇺🇸 claude-opus-4-7-thinking Anthropic 1553 ±7 11799 $5 / $25 1M 3 🇺🇸 claude-opus-4-6-thinking Anthropic 1551 ±6 14089 $5 / $25 1M 4 🇺🇸 claude-opus-4-7 Anthropic 1550 ±7 12135 $5 / $25 1M 5 🇺🇸 claude-opus-4-6 Anthropic 1548 ±6 15989 $5 / $25 1M 6 🇺🇸 claude-opus-4-8 Anthropic 1537 ±9 6195 $5 / $25 1M 7 🇺🇸 claude-opus-4-8-thinking Anthropic 1537 ±9 6075 $5 / $25 1M 8 🇺🇸 claude-opus-4-5-20251101-thinking-32k Anthropic 1530 ±7 7622 $5 / $25 200K 9 🇺🇸 claude-sonnet-4-6 Anthropic 1527 ±7 13275 $3 / $15 1M 10 🇨🇳 qwen3.7-max-preview 预发布 阿里 1526 ±18 1128 $1.25 / $3.75 1M — 以下为 Top 10 外的国产模型 — 17 ↑1 🇨🇳 mimo-v2.5-pro 小米 1520 ±8 9398 $0.44 / $0.87 1.05M 28 — 🇨🇳 kimi-k2.6 月之暗面 1512 ±7 8944 $0.95 / $4 262.1K 29 ↓2 🇨🇳 ernie-5.1 百度 1512 ±7 9043 N/A N/A 30 ↑2 🇨🇳 qwen3.7-plus 阿里 1512 ±10 4288 $0.32 / $1.28 1M 数学榜 数学榜头部依然被 🇺🇸 Anthropic 占据,🇺🇸 claude-opus-4-6-thinking 以 1518 分稳居第一,🇺🇸 gpt-5.5 排名提升 4 位来到第 8 名,是本次榜单中排名上升最多的模型,🇺🇸 glm-5.2 (max) 排名提升 8 位至第 24 名,变动幅度较大。 国产模型方面,月之暗面 kimi-k2.6 排名提升 2 位至第 13 名,阿里 qwen3.7-max-preview 上升 1 位至第 10 名,整体保持稳定。 长文本榜 长文本榜本周榜首易主, 🇺🇸 claude-fable-5 从第二升至第一 ,ELO 分数达到 1524 分,原榜首 🇺🇸 claude-opus-4-6-thinking 降至第二,两者分差仅 1 分,属于统计误差范围内并列。国产小米 mimo-v2.5-pro 排名上升 1 位至第 14 名,OpenAI gpt-5.5-high 排名提升 3 位至第 16 名,变动较为明显。 总体来看,本周 Arena 大模型周榜整体格局稳定,Anthropic 依然在各榜单头部占据垄断地位,美国厂商头部优势依旧明显。国产模型整体排名保持稳定,阿里 qwen3.7-max-preview 在多个榜单中稳居前 15~20 名,已经进入全球第一梯队末尾水平。下周值得关注国产新模型的动态,以及谷歌、OpenAI 新模型是否会带来排名格局变化。