DeepSeek 发布了新模型,性能提升 4.87%,成本只有 0.07 美元,比很多模型便宜很多。
#Agent Arena
Meta 新发布的 Muse Spark 1.3 (Max) 在 Agent Arena 中表现提升明显,排名从第30位跃升至第13位,性能提升显著,值得关注。
DeepSeek新出的V4.1-Flash模型参加Agent Arena竞赛,你可以去投票看看它的表现,这个模型设计得更智能、更快、更高效。
OpenAI发布了GPT-6 Astra (Max),在Agent Arena中排名第二,用户评价和成功率大幅提升,成本表现也很有竞争力。
Anthropic的Claude Fable 5.1 (Max)在Agent Arena排名第一,性能领先但成本较高,用户满意度极高。
GoogleDeepMind 新发布的 Gemini 3.8 Flash (High) 在多个竞技场表现优异,成本比同类模型低 44-50%。
GoogleDeepMind发布Gemini 3.8 Flash (High),在多个基准测试中超越前代版本和Claude Opus 5。
Check out the Pareto frontier for Agent Arena to see performance across different categories. It's a great way to compare agents!
Meta 刚刚发布了 Muse Spark 1.2 (xHigh),在 Agent Arena 上的净提升分数从 0.9% 提升到了 2.1%,Bash Recovery 任务直接翻倍,比前代强了不少。
DeepSeek发布的V4 - Pro (High),比前代版本强,成本还低,在开放模型里排第二,可以去试试。
想知道代码、工作、聊天分别谁最强?Agent Arena 新榜单给出答案:GPT 5.6 和 Claude Opus 5 各领风骚。
谷歌新出的Gemini 3.7 Flash在智能体评测里冲到第20,比上代强一截,编码和网页开发更好用了,感兴趣的可以试试。
Upstage 发了主打智能体任务的 Solar Pro 4,定价不高,Agent Arena 排名和 MiniMax M2.7 同级,适合处理长文档和多轮工具调用。