#Agent Arena
Nano Banana 2.1在图像生成领域表现亮眼,Mistral Large 4在欧洲实验室中排名领先,Claude Haiku 5.5性价比突出。
Anthropic 放出了 Claude Haiku 5.5,比 4.5 便宜七成五,还能在 Agent Arena 里跑真实任务,去试试手感。
Arena.ai 更新了 Agent Arena 榜单,Anthropic 和 OpenAI 的模型在真实任务上谁强谁弱,一目了然。
Anthropic 新版 Sonnet 5.5 排名很猛,Chat 类第一,编码只差 GPT-6 两分还便宜 20%,就是单任务贵了七成。
Anthropic的Claude Sonnet 5.5在Agent Arena表现亮眼,但成本比Opus 5.5高73%,性价比如何?
小米新发布的MiMo-V2.6系列在Agent Arena表现亮眼,Pro版本性能接近Claude Opus 5和GPT-5.6,且是开源模型中AI指数最高的。
GoogleDeepMind的Gemini 4 Argon (High)在多个基准测试中表现优异,成本效益高,特别是在文本生成和网页开发领域。
OpenAI 新模型在 Agent Arena 用一半价格逼近 Claude Fable 5 的表现,做智能体应用的成本压力小多了
OpenAI 的 GPT-6 Sol 上 Agent Arena 了,净改进 +7.7% 排第 6,确认成功率排第 4,API 价格还比 GPT-5.6 便宜一半。
xAI 的 Grok 4.7 上 Agent Arena 榜了,任务成功率明显变好,但单任务价格从 $0.74 涨到 $1.14,省钱党可以先观望。
LangChain 搞了个好玩的展台:你打 30 秒俄罗斯方块,AI 学你的路子再挑个模型替你上场比赛,不同模型水平一眼见分晓。
OpenAI 把 GPT-6 Astra 的能力下放到了 Sol 和 Luna 两个便宜一半的新模型上,还能在 Agent Arena 里亲手测试投票。
Claude Opus 5.5 进 Agent Arena 了,你的 toughest prompt 能直接给模型出难题投票,还能看到它在 WebDev、Vision 等赛道的对战成绩。
Arena 拆了 20840 条编码智能体反馈:69% 差评是代码跑不通,Fable 5.1 比 Astra 更少被吐槽。