LMArena 上线 Opus 5.5 试用,支持 Battle Mode 和 Agent Mode
想在正式发布前试试 Opus 5.5 的可以去 arena.ai,既能盲测对比,还能开 Agent Mode 跑任务。
想在正式发布前试试 Opus 5.5 的可以去 arena.ai,既能盲测对比,还能开 Agent Mode 跑任务。
LMArena 把 Code Arena(WebDev)和 Text Arena 的完整榜单放出来了,想看模型在网页开发和文本任务上的排名,直接点链接查。
谷歌 DeepMind 的新 Flash 模型在 WebDev 榜冲到第8,比上代进步不小,做网页或数据任务可以试试。
xAI 把 Grok 4.6 放出来了,网页开发能力直接冲到 LMArena 第7,跟 GPT-5.6 和 Claude 最新版就几分之差,这代提升挺猛。
Grok Imagine Image 2.0 (Low) 在图像编辑榜冲到第二,1439 分,比自家 Quality 版升了 5 位,值得一试。
OpenAI 的 GPT-5.6 三兄弟开测,Sol 全栈第 3,Terra 和 Luna 也进 top20,挑模型看这个。