看Opus 5和GPT-5.6-Sol在同一基准上的表现,一个越强越费token,一个越强越省,挺有意思的对比。
#Agent Arena
Meta 把 Muse Spark 1.2 放进 Agent Arena 让大家拿难题测它,还出了个终端编码代理 Muse Code,能干多文件改代码的活,可以去试试。
DeepSeek新模型V4-Flash跑Agent任务每单只要0.024美元,比GPT-5.6 Luna还便宜,性价比很能打。
DeepSeek 新模型在 Agent Arena 排开源第三,API 上线且支持 Codex,做智能体可以试试。
DeepSeek 把 V4-Flash 放进 Agent Arena,API 公测也开了,智能体跑分超过 V4-Pro-Preview,还适配 Codex,想试的可以看看。
Anthropic 的 Opus 5 在 Agent Arena 上超过 GPT-5.6,你也能用自己提示词在 agent 模式里测试它。
想比较 Claude Opus 5 和 GPT 5.6 在真实智能体任务上的表现?这份报告用 7000+ 次任务告诉你谁更强、谁更划算。
Claude Opus 5 在 Agent Arena 和代码榜都冲进前三,Max 版更是双榜第一,比 GPT-5.6 还靠前,很强悍。
xAI发了Grok 4.6发布预告,同时4.5在Agent Arena上冲到了第13名,比4.3进步了16名,尤其Bash Recovery能力追上了Claude和GPT,推荐关注。
GPT-5.6 的 Sol 版在 Agent Arena 上表现亮眼,比 Terra 和 Luna 都强,直接对标 Claude Opus 4.8。想了解新模型实力的话可以看看。
Kimi 开源了 K3 模型,Agent Arena 直接干翻 GLM-5.2,净提升超 9%,代码和文本竞技场也是第一,值得关注。
Kimi K3 (Max) 在代码和智能体测试中双料夺冠,连 GLM-5.2 都比它低一截,开发者和研究者可以关注这个新标杆。
Anthropic新模型Claude Opus 5静态能力追平Fable 5,价格只要一半,还要在Agent Arena测真实任务,值得蹲分数。
想看看哪个 AI 智能体干活最靠谱、哪个写前端代码最好?这两个新排行榜给你真实用户投票结果,直接去 arena.ai 查。
Inkling是当前美国最强的开源模型,在Agent Arena排第9,擅长处理复杂工作流和CLI错误恢复,但用户反馈一般,你可以试试看它是否适合你。
Inkling 这个开源模型在 Agent Arena 里表现不错,Bash Recovery 尤其亮眼,想看看它和其他模型差距的可以关注。
Thinking Machines 出了个新模型 Inkling,能同时处理文字、图片和音频,还在 Agent Arena 上测了长期任务能力。现在能免费下载权重自己微调,可以试试。
想看看哪个模型最擅长完成真实世界的复杂任务?Agent Arena用百万任务和因果追踪方法给出了答案,比普通基准更贴近实际。
Meta 终于入局智能体赛场,Muse Spark 1.1 一上榜就拿第五,还开放了 API 和思考模式,想试试新模型可以冲。
OpenAI 的 GPT-5.6 Sol 在 Agent Arena 上冲到第2,离 Claude Fable 5 更近了。看看具体指标差异,特别是用户满意度的信号。
Grok-4.5 是 SpaceXAI 的首个编程+智能体专用模型,在 Agent Arena 上从29名跳到13名,Bash Recovery 追平了Claude和GPT,实测任务成功率很高。
OpenAI的GPT-5.6 Sol在Agent Arena上冲到第二,比前代进步明显,和Claude Fable 5差距缩小了,想看看真实任务中模型表现的话值得关注。
OpenAI 把 GPT-5.6 三兄弟 Sol、Terra 和 Luna 放到 Agent Arena 里了,能跑真实世界智能体任务,还能用网络和终端工具,去投个票就能影响排行榜。