8月21日
06:13
8月19日
01:33
7月15日
01:17
7月5日
03:03
03:03lmarena.ai@lmarena_ai
Fable 5模型重回LMSys Chatbot Arena,官方发布了一段蒙太奇视频,展示多个测试prompts。用户可以在Battle Mode和Agent Mode中直接体验该模型。官方排行榜分数即将公布,供社区参考。
事件专题

推荐理由:Fable 5又回Arena了,还加了Agent模式,想自己动手测测看?直接去Battle Mode里玩,官方排名马上出。
7月3日
08:10
08:10lmarena.ai@lmarena_ai
Arena平台启动Claude Fable 5的Battle Mode和Agent Mode测试,覆盖文本、图像等多模态输入。用户可参与投票,直接影响最终排行榜分数。排行榜结果即将在arena.ai公布。该测试用于评估模型的多模态能力和智能体行为。
事件专题

推荐理由:Arena开始让大家测Claude Fable 5了,有Battle和Agent两种模式,你还能投票影响排名,快去试试。
6月23日
6月17日
10:40
10:40lmarena.ai@lmarena_ai
精选
GLM-5.2 (Max) 在 Arena 榜单上整体排名第10,较之前上升4.4%。工具幻觉指标并列第1,提升1.9%。确认任务成功排第3,提升9.4%。赞比投诉排第3,提升14.9%。Bash 恢复排第16,提升1.7%;可操控性排第20,下降6.0%。

推荐理由:GLM-5.2 (Max) 在工具幻觉和任务成功率上表现突出,综合排名上升4.4%,值得看看它在这些指标上的优势。
6月5日
6月1日
11:07
11:07lmarena.ai@lmarena_ai
精选76°
MiniMax 发布开源权重模型 M3,首次在单一模型中融合编码、智能体与多模态三大前沿能力。在 SWE-Bench Pro 上达到 59.0%,Terminal Bench 2.1 为 66.0%,并支持 1M 上下文长度。模型已上线 Arena 的文本、视觉、文档和代码竞技场,用户可投票评测。权重和技术报告将在约 10 天后公开。

推荐理由:MiniMax M3 把编码、智能体和多模态塞进一个开源模型,做 AI 应用和 Agent 开发的团队可以直接在 Arena 上测效果,省去自己搭环境的时间。
5月27日
14:14
11:18
11:18lmarena.ai@lmarena_ai
MAI-Image-2.5 是一款新的图像生成模型,将于下周在 MAI Playground 和 Foundry 平台上线。目前该模型已在 Arena 上提供公开早期访问,用户可以通过 arena.ai/image 链接体验。这一发布意味着开发者可以提前试用并评估模型能力,为后续集成做准备。
推荐理由:图像生成领域又添新选择,做 AI 图像应用或内容创作的开发者可以趁早访问 Arena 体验 MAI-Image-2.5 的实际效果,抢占先机。
5月19日
12:01
12:01Geek@geekbb
72°
阿里巴巴通义千问团队发布了 Qwen 3.7 预览版,包括 Max 和 Plus 两个版本,已在 LMSYS Arena 上线。该模型在文本和视觉任务上表现强劲,使阿里在 Arena 文本榜单升至第6、视觉榜单升至第5。官方表示完整系列模型即将发布,值得期待。
推荐理由:Qwen 3.7 预览版在 Arena 上表现亮眼,阿里排名大幅提升,做多模态或文本生成的应用开发者可以关注后续正式版发布。
11:46
11:46官方账号阿里云 Alibaba Cloud@alibaba_cloud
72°
阿里云宣布 Qwen3.7-Max-Preview 模型已上线 Arena 平台,在文本任务中排名第6。该模型是 Qwen3.7 系列的预览版本,预计正式版将很快发布。这一进展展示了阿里云在大语言模型领域的持续投入和竞争力提升。
推荐理由:Qwen3.7 系列即将发布,关注国产大模型进展的开发者可以提前了解预览版表现,为后续集成做准备。