#Arena
AgileRL 把 Nemotron 3.5 Lightning 放到 Arena 上微调,6 小时就能超过 Claude Sonnet 5,训练完权重还归你。
Black Forest Labs的FLUX 3 Video更新版在Arena冲到第二,只差Gemini 16分,支持原生音频和多语言对话,想玩视频生成可以试试。
这周榜单有意思:阿里qwen3.8-max追平Claude,Meta新模型第4,kimi代码第6,信息量足。
谷歌跳票几个月的 Gemini 3.5 Pro 突然在盲测平台露脸半小时又被撤,想看看它真实水平的人可以去翻用户截图。
以后看模型排名不只凭喜好,还能按事实准确性排序。GPT-5.5 狂飙 13 名,Claude 也被挤到第二,快去 Arena 开开关看看。
想快速了解本周最强AI模型?Arena周榜给出硬核排名:代码能力claude-opus-4-7-thinking超了claude-fable-5,国产qwen3.7也稳在Top20。
Arena开始让大家测Claude Fable 5了,有Battle和Agent两种模式,你还能投票影响排名,快去试试。
Arena 从用户投票排行榜做到商业产品,8 个月年收入破亿,说明模型评测确实能赚钱。对比 Yupp 的关停,看看差异化在哪。
想了解AI模型评测怎么运作的?Arena团队亲自拆解从内测到上线的完整评估流程,还讲了Bradley-Terry分数如何保证公平,干货满满。
Arena 的 Agent Mode 让开发者能直接对比主流模型在真实复杂任务上的表现,做智能体应用选型的团队值得亲自上手测试,结果会直接影响排行榜。
Arena 的 Agent Mode 让开发者可以直接对比前沿模型在真实任务中的表现,做 AI 评测或选型的团队值得一试。
MiniMax M3 把编码、智能体和多模态塞进一个开源模型,做 AI 应用和 Agent 开发的团队可以直接在 Arena 上测效果,省去自己搭环境的时间。
xAI 的视频模型首次登顶 Arena,做 AI 视频生成或内容创作的团队值得关注这个新选择,看看它能否在效果和速度上带来惊喜。
做设计、营销或内容创作的团队终于有了更靠谱的商用级生图工具——文字渲染和视觉推理的提升让海报、包装这类需求不再翻车,建议直接去 Arena 试效果。
图像生成领域又添新选择,做 AI 图像应用或内容创作的开发者可以趁早访问 Arena 体验 MAI-Image-2.5 的实际效果,抢占先机。