8月25日
05:06
8月21日
01:41
01:41lmarena.ai@lmarena_ai
精选
Meta 发布了 Muse Spark 1.2 (xHigh) 模型。该模型在 Agent Arena 基准测试中实现了 +2.1% 的净提升。相比前代 Muse Spark 1.1,其净提升分数从 0.9% 提升至 2.1%。在 Bash Recovery 任务上,性能从 +5.9% 提升到 +11.4%。

推荐理由:Meta 刚刚发布了 Muse Spark 1.2 (xHigh),在 Agent Arena 上的净提升分数从 0.9% 提升到了 2.1%,Bash Recovery 任务直接翻倍,比前代强了不少。
01:37
01:37lmarena.ai@lmarena_ai
Agent Arena 排行榜衡量模型在数百万个真实世界、长周期任务中的表现。模型可使用网络搜索、文件系统和终端工具完成复杂工作流。该榜单通过因果追踪方法,衡量模型相对于平均模型的结果表现。
推荐理由:看看 arena.ai 上新出的 Agent Arena 排行榜,它用真实任务测试模型,还能用工具,比普通测试更实用。
8月20日
07:36
07:36
07:36lmarena.ai@lmarena_ai
精选76°
DeepSeek - V4 - Pro (High) 以+6%净提升成为开放模型领域Agent Arena第2名;与DeepSeek - V4 - Flash (High) 相比,其性能更高且任务成本更低;在代码和工作类别排名第2,聊天类第5,多项指标表现突出。

推荐理由:DeepSeek发布的V4 - Pro (High),比前代版本强,成本还低,在开放模型里排第二,可以去试试。
03:31
03:31lmarena.ai@lmarena_ai
Agent Arena对比了15款模型任务成本,Kimi K3 (Max)每任务成本仅$0.62;Claude Opus 5 (Max)成本达$3.37,与同类存在明显差距;Kimi K3 (Max)排名第4,成本远低于多数同级别模型;Grok和Qwen以较低成本实现了不错表现。
事件专题

推荐理由:Agent Arena发布了各模型任务成本对比,能清楚看到不同模型花多少钱和效果,和同类比啥不一样。
8月19日
01:49
8月18日
07:17
07:17lmarena.ai@lmarena_ai
精选71°
Agent Arena 新增代码、工作、聊天三个分类榜单。代码榜第一是 OpenAI 的 GPT 5.6 Sol(xHigh)。工作榜和聊天榜第一均为 Anthropic 的 Claude Opus 5(High 和 Max)。该评测基于数百万真实长时程智能体任务,单次长会话成本可达数百至一千美元。
事件专题

推荐理由:想知道代码、工作、聊天分别谁最强?Agent Arena 新榜单给出答案:GPT 5.6 和 Claude Opus 5 各领风骚。
8月8日
04:00
8月4日
7月31日
7月30日
7月28日
06:11
06:11lmarena.ai@lmarena_ai
精选
GPT-5.6 的 Sol、Terra、Luna 三个变体在 Agent Arena 中以 xHigh 设置进行测试。Sol 以 +10.1% 的净改进位列排行榜第二。Terra (+4.0%) 和 Luna (+3.3%) 也取得正向提升,与 Claude Opus 4.8 (+3.5%) 的水平相当。

推荐理由:GPT-5.6 的 Sol 版在 Agent Arena 上表现亮眼,比 Terra 和 Luna 都强,直接对标 Claude Opus 4.8。想了解新模型实力的话可以看看。
02:52
7月25日
7月22日
06:43
06:43lmarena.ai@lmarena_ai
Chatbot Arena 推出了 Agent Arena 和 Frontend Code Arena 两个新排行榜。Agent Arena 评估 AI 智能体在真实世界任务中的表现,Frontend Code Arena 专门评测模型的前端代码生成能力。排行榜数据来自用户对战投票,结果实时更新在 arena.ai 上。
推荐理由:想看看哪个 AI 智能体干活最靠谱、哪个写前端代码最好?这两个新排行榜给你真实用户投票结果,直接去 arena.ai 查。
7月21日
04:23