GoogleDeepMind的Gemini 4 Argon (High)在多个基准测试中表现优异,成本效益高,特别是在文本生成和网页开发领域。
#Text Arena
Anthropic 的 Opus 5.5 (High) 拿下 Text Arena 第一,1509 分比上一代高 18 分,前六名全是他们家,价格数据也标出来了。
Claude Opus 5.5 (High) 在 Text Arena 拿了 1509 分,价格每百万 token 16 美元,选模型时可以参考这个性价比坐标。
Text Arena 拆了 Opus 5.5 和 5 的写作差异:句子短了 17%,破折号少 95%,但含糊词翻倍,写东西前可以看看。
GoogleDeepMind发布Gemini 3.8 Flash (High),在多个基准测试中超越前代版本和Claude Opus 5。
Gemini 3.7 Flash在Text Arena冲到第9,创意写作第3,数学第4,跟Qwen-3.8和Claude Opus 5只差几分。
LMArena 把 Code Arena(WebDev)和 Text Arena 的完整榜单放出来了,想看模型在网页开发和文本任务上的排名,直接点链接查。
DeepSeek新模型在Text Arena拿1465分,和GLM-5.1、GPT-5.6 Terra一个水平,开源阵营排第五。
Meta 发布终端编程代理 Muse Code,能改多文件大项目,基于 Muse Spark 1.2,Text Arena 排第四,价格不贵。
Inkling-Small只用12B激活参数就逼近DeepSeek V4 Flash,开放模型里排21名,少算力也能打,关注后续人投排名。
Thinking Machines 新出的开源模型,276B 参数但只激活 12B,一发布就挤进 Text Arena 前 100,美国厂商里排前几,想试大参数但轻量推理的可以看看。
Anthropic 的 Claude Opus 5 刚发布就刷榜,在编码和文本两个任务上超过了之前很火的 Kimi K3,值得关注。
Anthropic 的 Claude Opus 5 在多个 Arena 基准上拿了第一,价格还比 Fable 5 便宜一半。做前端编码或文档推理的朋友可以重点关注。
中美AI差距从278%缩到2.7%,做模型评测或关注国际竞争的团队值得一看——百度Ernie 5.1已经能跟Claude Opus 4.6 Thinking掰手腕了。