03:02lmarena.ai@lmarena_ai精选Gemini 3.7 Flash (High) 在 Text Arena 中以1490分排名第9,较前代 Gemini 3.6 Flash (High) 的第16位明显提升。分项中创意写作从第12升至第3,数学从第7升至第4,指令跟随从第17升至第9,多轮对话从第21升至第10。其得分与 Qwen-3.8 (Max) 的1491分、Claude Opus 5 (Max) 的1493分几乎持平。AI模型Gemini 3.7 FlashText ArenaQwen-3.8推荐理由:Gemini 3.7 Flash在Text Arena冲到第9,创意写作第3,数学第4,跟Qwen-3.8和Claude Opus 5只差几分。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
02:46lmarena.ai@lmarena_ai精选arena.ai更新了Code Arena: WebDev和Text Arena的帕累托前沿图。帕累托前沿展示了不同模型在多维性能上的最优组合。用户可据此快速比较模型,并跳转到对应排行榜查看详细数据。AI模型Code ArenaText Arena帕累托前沿推荐理由:想去arena.ai找代码或文本任务的最强模型?看这个帕累托前沿图,一眼就能知道哪些模型在权衡点上更值。原文稍后读已读值得跟进有用关注 Code Arena
02:45lmarena.ai@lmarena_aiLMArena 官方发布了 Code Arena 的 WebDev 子榜与 Text Arena 的完整排行榜。两份榜单均托管在 arena.ai 的 leaderboard 页面下。该榜单基于用户对战投票,反映模型在网页开发与文本任务上的能力对比。具体模型排名可在对应页面查看。AI产品LMArenaCode ArenaText Arena推荐理由:LMArena 把 Code Arena(WebDev)和 Text Arena 的完整榜单放出来了,想看模型在网页开发和文本任务上的排名,直接点链接查。原文稍后读已读值得跟进有用关注 LMArena
17:50lmarena.ai@lmarena_aiDeepSeek-V4-Pro (Max)在Text Arena开源模型榜单中位列第五,AutoEval得分为1465。该分数与GLM-5.1的1467分、GPT-5.6 Terra (xHigh)的1464分以及Grok 4.6 (High)的1464分基本持平。该排名来自@deepseek_ai的官方发布,针对的是文本竞技场中的开源模型。AI模型DeepSeekDeepSeek-V4-ProText Arena10 个信源在谈事件专题推荐理由:DeepSeek新模型在Text Arena拿1465分,和GLM-5.1、GPT-5.6 Terra一个水平,开源阵营排第五。原文稍后读已读值得跟进有用关注 DeepSeek
00:43lmarena.ai@lmarena_ai73°arena.ai 的 Text Arena 排行榜与 Vision Arena 排行榜现已开放完整版。Text Arena 展示文本模型的表现,Vision Arena 展示视觉模型的表现。用户可直接访问 arena.ai 的两个页面查看排名。AI模型Text ArenaVision Arenaarena.ai1 个信源在谈事件专题推荐理由:想比较文本或视觉模型实力?直接上 arena.ai 看这两个排行榜,一手数据。原文稍后读已读值得跟进有用关注 Text Arena
00:17lmarena.ai@lmarena_aiMeta 发布 Muse Code 测试版,这是一个面向长周期软件工程任务的终端编码代理。Muse Code 由新模型 Muse Spark 1.2 驱动,可在大型代码仓库中规划、实现和验证复杂的多文件更改。Muse Spark 1.2 (xHigh) 在 Text Arena 排名第四,得分 1498 分。该模型定价为每百万 token 1.25 美元/4.25 美元。AI产品Muse CodeMuse SparkMeta10 个信源在谈事件专题推荐理由:Meta 发布终端编程代理 Muse Code,能改多文件大项目,基于 Muse Spark 1.2,Text Arena 排第四,价格不贵。原文稍后读已读值得跟进有用关注 Muse Code
02:53lmarena.ai@lmarena_ai精选Inkling-Small在Text Arena获得约第88名,AutoEval得分1431,开放模型中约第21。它仅用12B激活参数(总276B),比肩Minimax M2.7(1417分,10B激活)、Nemotron 3 Ultra(1426分,55B激活)和DeepSeek V4 Flash(1436分,13B激活)。该分数为AutoEval初步结果,由奖励模型代替人工投票产生。AI模型Inkling-SmallthinkymachinesText Arena4 个信源在谈事件专题推荐理由:Inkling-Small只用12B激活参数就逼近DeepSeek V4 Flash,开放模型里排21名,少算力也能打,关注后续人投排名。原文稍后读已读值得跟进有用关注 Inkling-Small
03:39lmarena.ai@lmarena_ai精选Thinking Machines 发布 Inkling-Small,总参数量 276B,其中 12B 活跃。该模型在 Text Arena 的 AutoEval 初评中获得 1431 分,排名 #88,并在开放模型中位列 #21。它是美国仅有的五个进入开放模型前 25 的模型之一。初始分数基于 Arena 人类偏好数据训练的奖励模型自动投票得出,待与真实投票验证。AI模型Inkling-SmallThinking MachinesText Arena3 个信源在谈事件专题推荐理由:Thinking Machines 新出的开源模型,276B 参数但只激活 12B,一发布就挤进 Text Arena 前 100,美国厂商里排前几,想试大参数但轻量推理的可以看看。原文稍后读已读值得跟进有用关注 Inkling-Small
16:26AI Will@FinanceYF5Claude Opus 5(Max 推理版)在 Frontend Code Arena 和 Text Arena 两个基准测试中均取得第一,超越此前领先的 Kimi K3。其默认 high 推理版本表现也不错,在 Code Arena 排名第三(仅次于 Kimi K3),在 Text Arena 排名第二。这一成绩显示 Claude 系列在编码和文本推理任务上的最新进展。AI模型Claude Opus 5Kimi K3Frontend Code Arena10 个信源在谈事件专题推荐理由:Anthropic 的 Claude Opus 5 刚发布就刷榜,在编码和文本两个任务上超过了之前很火的 Kimi K3,值得关注。原文稍后读已读值得跟进有用关注 Claude Opus 5
05:17lmarena.ai@lmarena_ai79°Claude Opus 5 在 LMSYS Arena 的 Frontend Code Arena 中排名第一,Text Arena(factuality 开启)也位列第一。开启默认高推理模式时,它在 Frontend Code Arena 排第三,仅次于 Kimi K3,在 Text Arena 排第二。该数据基于真实世界任务,包括智能体网页编码、文档推理和通用对话。Anthropic 发布的新模型在价格减半的情况下接近 Fable 5 的前沿智能水平。当前 Claude Opus 5 Max 的评分仍为初步结果,后续会更新。AI模型Claude Opus 5AnthropicLMSYS Arena10 个信源在谈事件专题推荐理由:Anthropic 的 Claude Opus 5 在多个 Arena 基准上拿了第一,价格还比 Fable 5 便宜一半。做前端编码或文档推理的朋友可以重点关注。原文稍后读已读值得跟进有用关注 Claude Opus 5
03:58lmarena.ai@lmarena_aiGLM-5.2 (Max) 在 Text Arena 总榜排名第25位,与上一版本 GLM-5.1 水平接近。在 Expert Arena 和 Multi-Turn 子类别中取得较大进步。在生命科学、社会科学、创意写作和医学医疗等职业类别中表现提升。AI模型GLM-5.2GLM-5.1智谱推荐理由:智谱新模型 GLM-5.2 整体排名没变,但在专家问答和多轮对话上进步明显,写创意和医学内容更强了。原文稍后读已读值得跟进有用关注 GLM-5.2
23:22lmarena.ai@lmarena_aiGLM-5.2 模型已在 Text Arena 和 Code Arena: Frontend 中可用。用户可以通过 arena.ai/agent 平台测试该模型在真实世界任务上的表现。该平台旨在评估 AI 性能的前沿。AI模型GLM-5.2Text ArenaCode Arena推荐理由:试试 GLM-5.2 在真实任务中的表现原文稍后读已读值得跟进有用关注 GLM-5.2
22:17lmarena.ai@lmarena_ai73°斯坦福AI指数报告显示,中美AI模型差距已从三年前的278%缩小至仅2.7%。实际评测中,Anthropic的Claude Opus 4.6 Thinking与百度的Ernie 5.1在Text Arena排行榜上紧咬,美国虽仍居第一,但差距持续收窄。这一趋势反映了中国AI模型的快速追赶,尤其在推理和对话能力上。对关注全球AI竞争格局的从业者而言,这是重要的风向标。行业中美AI竞争模型评测Claude Opus 4.610 个信源在谈事件专题推荐理由:中美AI差距从278%缩到2.7%,做模型评测或关注国际竞争的团队值得一看——百度Ernie 5.1已经能跟Claude Opus 4.6 Thinking掰手腕了。原文稍后读已读值得跟进有用关注 中美AI竞争