8月14日
02:46
02:46lmarena.ai@lmarena_ai
精选
arena.ai更新了Code Arena: WebDev和Text Arena的帕累托前沿图。帕累托前沿展示了不同模型在多维性能上的最优组合。用户可据此快速比较模型,并跳转到对应排行榜查看详细数据。
推荐理由:想去arena.ai找代码或文本任务的最强模型?看这个帕累托前沿图,一眼就能知道哪些模型在权衡点上更值。
01:20
8月11日
09:29
8月8日
13:58
8月7日
23:44
23:44lmarena.ai@lmarena_ai
Frontend Code Arena 的完整排行榜页面位于 arena.ai/leaderboard。Frontend Code Arena 展示前端编码场景下的模型排名。arena.ai/leaderboard 是官方公布的榜单入口。访问 Frontend Code Arena 可查看完整排名。
事件专题

推荐理由:想挑个会写前端的模型?去 Frontend Code Arena 榜单看排名就行,入口在 arena.ai/leaderboard。
23:43
8月5日
09:41
7月21日
04:23
01:31
7月17日
00:34
7月3日
08:08
6月17日
03:28
03:28lmarena.ai@lmarena_ai
Agent Arena 是一个智能体性能排行榜,现已在 arena.ai/leaderboard/ag... 上线。用户可通过按开放模型或按实验室(lab)筛选来查看详细数据。该排行榜为不同智能体模型提供了直接的性能对比基准。
推荐理由:想比对比不同智能体模型?去Agent Arena排行榜,能按开放模型或实验室筛选,帮你找到合适的。
6月9日
6月8日
19:01
19:01AI Will@FinanceYF5
Claude Opus 4.7 在 Android Arena 排行榜中以 1313 Elo 分排名第一,超越 OpenAI 的 GPT-5.5 和谷歌的 Gemini 3.5 Flash。Anthropic 在前十名中占据五个席位,显示出其在移动端 AI 领域的强势地位。该排行榜主要评估模型在安卓设备上的实际表现,对移动端 AI 应用开发者有重要参考价值。
事件专题

推荐理由:移动端 AI 开发者可以快速了解当前安卓设备上最强的模型格局——Claude Opus 4.7 领先,Anthropic 整体优势明显,值得关注其技术路线。
6月7日
00:48
00:48lmarena.ai@lmarena_ai
精选72°
Agent Arena 排行榜发布方法论深度解读,通过因果推断评估模型的智能体性能。排行榜基于五个信号:任务成功率、可操控性、错误恢复能力、用户表扬与投诉比、工具幻觉率。这为评估 AI 智能体能力提供了更全面的框架,帮助开发者理解模型在实际任务中的表现。
推荐理由:做 AI 智能体评估的团队终于有了更科学的参考框架——五个信号覆盖了任务执行和用户体验,值得研究评测方法的开发者点开细看。
6月6日
6月5日
6月4日
07:42
07:42Ideogram@ideogram_ai
Ideogram 4.0 在第三方评测平台 DesignArena 的排行榜上成为全球第一的开源权重文生图模型。其性能仅次于 OpenAI 和 Google 的闭源模型,在开源模型中处于领先地位。该模型提供前沿质量、完全可定制性和数据隐私保护。这标志着开源文生图模型在质量上又迈出了一大步。
事件专题

推荐理由:开源社区终于有了一个能接近闭源巨头(OpenAI/Google)的文生图模型,做图像生成应用或研究的团队可以直接下载权重,享受前沿质量与数据隐私。
5月17日
01:41
01:41berryxia@berryxia
Slides Arena 发布了基于 370 万+ 真实创作者使用场景的 Agentic Slides 排行榜,Anthropic 的 Opus 4.7 包揽前两名,智谱的 GLM 5.1 位列第三。该排行榜基于真实世界的幻灯片生成场景,强调逻辑、创意和设计感,而非实验室 benchmark。结果显示 Claude 在 Agentic 设计领域仍具领先优势,但 GLM 表现亮眼。
事件专题

推荐理由:做 PPT 设计或 Agentic 内容生成的团队,这份基于 370 万真实场景的排行榜值得参考——GLM 5.2 能紧追 Opus 4.7,说明国产模型在创意密集型任务上已有竞争力,建议点开看看完整榜单。