Anthropic 的小模型 Haiku 5.5 上榜了,价格和 GPT-6 Luna 一样但分数更高,比自家 Haiku 4.5 便宜九成还涨分,做 Web 开发的可以看看性价比。
#Code Arena
GoogleDeepMind的Gemini 4 Argon (High)在多个基准测试中表现优异,成本效益高,特别是在文本生成和网页开发领域。
OpenAI 新版 GPT-6.1 Sol 性价比飙升,性能接近 Astra 但只需五分之一价格,各领域排名全面上升。
OpenAI 把 GPT-6 Astra 的能力下放到 Sol 和 Luna 两个便宜模型,Luna 编码榜涨了 74 分,API 价格还砍了一半,跑批量任务可以看看。
Anthropic 新的 Claude Opus 5.5 (Max) 在 Code Arena 编程榜拿了第一,价格还比 GPT-6 Astra 便宜 60%,写代码的可以看看实测视频。
Anthropic 新发的 Claude Opus 5.5 直接拿下 Code Arena 网页开发榜第一,比 Opus 5 高出 126 分,跑任务成本还降了 40%。
OpenAI 新的 GPT-6 Sol 在真实用户投票的 Code Arena 拿了第4,价格只要 Claude Opus 5 的一半不到,做 Web 开发的可以看看分数再决定用哪个。
xAI 的 Grok 4.7 (xHigh) 悄悄上线了,WebDev 排行榜冲到第10,比上一版涨了16分,价格速度还不变,写前端的朋友可以试试。
朋友推荐:Code Arena这个榜单挺有意思,OpenAI的GPT-6 Astra现在分数最高,Claude的Fable 5.1也还不错,看看哪个更适合做前端开发。
TencentHunyuan发布了Hy4预览,在Code Arena中表现优异,是开源模型中的佼佼者,值得一试。
LMArena 把 Code Arena(WebDev)和 Text Arena 的完整榜单放出来了,想看模型在网页开发和文本任务上的排名,直接点链接查。
Grok-4.6 刚发布就把网页开发能力冲进第一梯队,分数压过 Claude 和 GPT 的最新版,差距只有个位数,写代码的可以关注下。
DeepSeek新模型V4-Pro专攻代码生成,在Code Arena排第8,开源第2,仅次于Kimi K3,还超过了GPT-5.6 Sol。
DeepSeek 又发新模型了,V4-Pro (Max) 在编码榜上排开源第二,比贵得多的 Opus-4.8 还强,价格只要零头。