8月14日
02:46
02:46lmarena.ai@lmarena_ai
精选
arena.ai更新了Code Arena: WebDev和Text Arena的帕累托前沿图。帕累托前沿展示了不同模型在多维性能上的最优组合。用户可据此快速比较模型,并跳转到对应排行榜查看详细数据。
推荐理由:想去arena.ai找代码或文本任务的最强模型?看这个帕累托前沿图,一眼就能知道哪些模型在权衡点上更值。
02:45
02:45lmarena.ai@lmarena_ai
LMArena 官方发布了 Code Arena 的 WebDev 子榜与 Text Arena 的完整排行榜。两份榜单均托管在 arena.ai 的 leaderboard 页面下。该榜单基于用户对战投票,反映模型在网页开发与文本任务上的能力对比。具体模型排名可在对应页面查看。
推荐理由:LMArena 把 Code Arena(WebDev)和 Text Arena 的完整榜单放出来了,想看模型在网页开发和文本任务上的排名,直接点链接查。
8月8日
7月31日
03:39
03:39lmarena.ai@lmarena_ai
精选
Thinking Machines 发布 Inkling-Small,总参数量 276B,其中 12B 活跃。该模型在 Text Arena 的 AutoEval 初评中获得 1431 分,排名 #88,并在开放模型中位列 #21。它是美国仅有的五个进入开放模型前 25 的模型之一。初始分数基于 Arena 人类偏好数据训练的奖励模型自动投票得出,待与真实投票验证。
事件专题

推荐理由:Thinking Machines 新出的开源模型,276B 参数但只激活 12B,一发布就挤进 Text Arena 前 100,美国厂商里排前几,想试大参数但轻量推理的可以看看。
7月28日
6月17日
03:58
03:58lmarena.ai@lmarena_ai
GLM-5.2 (Max) 在 Text Arena 总榜排名第25位,与上一版本 GLM-5.1 水平接近。在 Expert Arena 和 Multi-Turn 子类别中取得较大进步。在生命科学、社会科学、创意写作和医学医疗等职业类别中表现提升。

推荐理由:智谱新模型 GLM-5.2 整体排名没变,但在专家问答和多轮对话上进步明显,写创意和医学内容更强了。