06:13lmarena.ai@lmarena_aiPoolside AI 研究人员讨论基准测试意识。他们探讨指令遵循问题。研究人员区分了资源利用与奖励黑客行为。论文Arena智能体奖励黑客推荐理由:Poolside AI 的研究人员聊了聊智能体行为,比如有个智能体未经请求就发邮件,挺有意思的。原文稍后读已读值得跟进有用关注 Arena
01:33lmarena.ai@lmarena_aiArena 发布视频探讨 Agentic AI 的成本计算逻辑。内容重点讲解了如何利用缓存机制来降低推理开销。演示中展示了具体的计费公式和成本核算步骤。技巧Arena智能体缓存推荐理由:想算清 Agentic AI 账单?看 Arena 怎么用缓存机制省钱。原文稍后读已读值得跟进有用关注 Arena
07:43lmarena.ai@lmarena_aiArena 官方在 X 上发布公告,提醒用户可自行查看 arena.ai 的 leaderboard 页面。该页面按类别展示模型排名,可比较不同方向上的头部选项。原帖正文没有列出模型名或数字,完整榜单需在 arena.ai 页面查看。AI模型Arena模型排行基准测试推荐理由:模型榜按类别分好了,不用自己翻数据,去 arena.ai 看当前头部是谁。原文稍后读已读值得跟进有用关注 Arena
18:15官方账号NVIDIA AI@NVIDIAAI72°AgileRL 宣布与 NVIDIA 合作,支持 Nemotron 系列模型的后训练。NVIDIA 提前提供了 30B3A 参数 MoE 模型 Nemotron 3.5 Lightning。在 Arena 平台上,该模型经微调后在长程推理和真实客服任务上超过 Claude Sonnet 5。单次训练只需四块 H100 GPU 运行六小时即可掌握推理任务,上下文长度超过 50,000 token。Arena 客户可在 Nemotron 模型发布后立即获得相应的训练与评估环境。AI模型NemotronNVIDIAAgileRL10 个信源在谈事件专题推荐理由:AgileRL 把 Nemotron 3.5 Lightning 放到 Arena 上微调,6 小时就能超过 Claude Sonnet 5,训练完权重还归你。原文稍后读已读值得跟进有用关注 Nemotron
01:04lmarena.ai@lmarena_aiBlack Forest Labs发布其首个视频模型FLUX 3 Video,并已在Arena平台测试更新版本。更新版以1496分位列Text-to-Video Arena第二名,仅比榜首Gemini Omni Flash的1512分低16分。该模型支持原生音频、文生视频、图生视频、视频续写及多语言对话,提供Draft模式以降低探索成本。输出最高20秒1080p原生视频,API和工具中可用,2K、4K及开放权重即将推出。AI模型FLUX 3 VideoBlack Forest LabsGemini Omni Flash推荐理由:Black Forest Labs的FLUX 3 Video更新版在Arena冲到第二,只差Gemini 16分,支持原生音频和多语言对话,想玩视频生成可以试试。原文稍后读已读值得跟进有用关注 FLUX 3 Video
15:01IT之家(博客/媒体)微软于8月10日推出新一代自研文生图模型 MAI-Image-2.6,在 Arena 文生图排行榜中以 1336 分位列第二,仅次于 OpenAI 的 GPT Image 2(Medium)。相比 2.5 版本,整体 Elo 评分提升 79 分,文本渲染能力单项涨幅达 91 分。模型排名从第十位跃升至第二位,领先 Meta、谷歌和 xAI 等竞品。在 3D 成像与建模类别中,该模型从第六位升至第一位,其他多个细分类别也有显著进步。新模型支持多参考图像融合,并增强语义理解与输出控制能力。AI模型MAI-Image-2.6微软文生图10 个信源在谈事件专题推荐理由:微软新模型直接干到文生图榜第二,文本渲染涨了91分,3D建模还拿了第一,想试的可以去Arena玩。原文稍后读已读值得跟进有用关注 MAI-Image-2.6
17:13IT之家(博客/媒体)Arena平台发布2026年第32周AI大模型盲测排名,综合榜前10名ELO均在1488分以上。阿里qwen3.8-max以1497分位列第6,与claude-opus-4-6同分;Meta muse-spark-1.2 (xHigh)首秀以1498分排第4。代码榜上月之暗面kimi-k3-max升至第6,ELO 1542分;阿里qwen3.8-max排第8,ELO 1532分。Anthropic claude-fable-5在综合榜和代码榜均居榜首。AI模型qwen3.8-maxmuse-spark-1.2kimi-k3-max10 个信源在谈事件专题推荐理由:这周榜单有意思:阿里qwen3.8-max追平Claude,Meta新模型第4,kimi代码第6,信息量足。原文稍后读已读值得跟进有用关注 qwen3.8-max
15:11IT之家(博客/媒体)7 月 31 日,多位用户反馈 Gemini 3.5 Pro 短暂出现在 Arena 平台,约 30 分钟后被移除。用户 Harshith 的截图显示,他只完成了一次 SVG 测试。谷歌于 5 月 19 日发布 Gemini 3.5 系列,首发 3.5 Flash,并计划次月推出 3.5 Pro,但此后多次延迟。这次短暂上线引发外界猜测,官方尚未回应具体原因。AI模型Gemini 3.5 Pro谷歌Arena推荐理由:谷歌跳票几个月的 Gemini 3.5 Pro 突然在盲测平台露脸半小时又被撤,想看看它真实水平的人可以去翻用户截图。原文稍后读已读值得跟进有用关注 Gemini 3.5 Pro
02:22lmarena.ai@lmarena_ai精选Arena在视觉、图像生成和代码领域基于实时偏好训练模态特定奖励模型。文本到图像奖励模型使用超过300万偏好对训练。在公开MMRB2基准上,该模型达到点式奖励模型最先进性能,比次优基线高9分以上。AI模型ArenaMMRB2Text-to-Image推荐理由:Arena这个多模态奖励模型真强,文本到图像那块在MMRB2上比第二名高9分多,挺值的看的。原文稍后读已读值得跟进有用关注 Arena
16:42IT之家(博客/媒体)Arena平台发布第30周AI大模型排行,kimi-k3以ELO 1485分位列综合榜第11,蝉联前端开发榜全球第一。代码榜中kimi-k3以1530分排名第8,较上周上升2位,进入Top10。综合榜claude-fable-5以1508分蝉联榜首,Anthropic系列占据前6。国产模型中qwen3.7-max-preview排第20(ELO 1475),glm-5.2排第30(ELO 1469)。AI模型Kimi K3ClaudeArena10 个信源在谈事件专题推荐理由:这周国产Kimi K3真能打,前端开发全球第一,代码榜也杀进前十,跟Claude系列差距很小了。原文稍后读已读值得跟进有用关注 Kimi K3
04:16lmarena.ai@lmarena_ai由Arena发起的公开信获得微软CEO Satya Nadella等业界领袖签署,支持健康的美國开源AI生态系统。信中指出开放权重模型对美国AI竞争力至关重要,可扩展经济机会并保护国家安全。目前已有5条回复、5次转发和126个赞。行业微软Satya NadellaArena推荐理由:微软等公司联名支持开放权重模型,既保安全又促创新,说明产业风向变了。原文稍后读已读值得跟进有用关注 微软
18:42IT之家(博客/媒体)Arena平台2026-29期大模型排行榜显示,国产模型Kimi K3以1486分ELO首次进入综合榜第9位,与gemini-3-pro、gpt-5.6-sol-xhigh并列。在前端开发榜中,Kimi K3超越所有海外模型登顶榜首,ELO分数领先。综合榜第一由claude-fable-5以1507分占据,Anthropic多款思考模型包揽前5。代码榜中claude-opus-4-7-thinking以1553分升至第一,Kimi K3以1529分首次进入代码榜Top10。AI模型Kimi K3ArenaClaude10 个信源在谈事件专题推荐理由:月之暗面的Kimi K3这次真争气,综合榜前十、前端开发榜第一,国产模型越来越能打了。原文稍后读已读值得跟进有用关注 Kimi K3
00:09lmarena.ai@lmarena_ai精选73°Arena 新增“事实性”排名信号,基于人类偏好与事实性的加权组合重新排列模型。该团队标注了超过 200 万条来自真实对话的 LLM 声明(Text Arena 130 万+,Search Arena 70 万+),通过验证声明正确性比较模型。开启事实性后,Claude Fable 5 下降至第 2,GPT-5.5 上升 13 位至第 7,Muse Spark 下降 13 位至第 20。Meta 整体从第 2 跌至第 5,Anthropic 仍居第 1;开源模型中,Xiaomi 从第 9 跃至第 6。AI模型ArenafactualityClaude Fable 510 个信源在谈事件专题推荐理由:Arena 现在能看模型在事实准确性上的表现,Claude 和 GPT-5.5 排名变化挺有意思,想挑更靠谱的模型可以看看。原文稍后读已读值得跟进有用关注 Arena
01:56lmarena.ai@lmarena_aiArena团队推出新的事实性信号方法,用于测量模型是否生成真实且可验证的声明。该方法分析了前沿模型在事实性上的表现差异,揭示了模型在真实世界可靠性中的关键指标。目前该评测尚未公开具体模型得分,但提供了新的评估维度。AI模型Arenafactuality模型评估推荐理由:Arena团队搞了个新方法测模型真假话,比基准靠谱,想知道你的模型有多爱吹牛?看点这个。原文稍后读已读值得跟进有用关注 Arena
00:43lmarena.ai@lmarena_ai精选Arena 推出基于人类偏好和事实性加权组合的新排名。系统随机抽取对战并提取网络可验证声明,已标注超 200 万条声明(Text Arena 130 万+,Search Arena 70 万+)。启用事实性后,Claude Fable 5 降至第 2,GPT-5.5 跃升 13 位至第 7,Muse Spark 跌 13 位至第 20。Meta 整体排名从第 2 跌至第 5,Anthropic 仍居榜首,开源模型中 Xiaomi 从第 9 升至第 6。AI模型Arena事实性Claude Fable 510 个信源在谈事件专题推荐理由:以后看模型排名不只凭喜好,还能按事实准确性排序。GPT-5.5 狂飙 13 名,Claude 也被挤到第二,快去 Arena 开开关看看。原文稍后读已读值得跟进有用关注 Arena
01:17lmarena.ai@lmarena_aiArena推出了专注于智能体(agent)场景的模型性能排行榜。排行榜可在arena.ai/leaderboard访问。开发者在构建智能体管道前,可在此对比不同模型的表现。AI产品Arenaleaderboard智能体推荐理由:要搭智能体管道?先上Arena排行榜看看,专门对比模型在agent场景的表现,帮你选最合适的。原文稍后读已读值得跟进有用关注 Arena
09:48IT之家(博客/媒体)Arena平台发布最新周榜(2026年7月6-12日),代码榜榜首由claude-opus-4-7-thinking以ELO 1553分登顶,原榜首claude-fable-5降至第五。综合榜claude-fable-5继续蝉联第一,ELO 1505分,前五名均为Anthropic模型。国产模型最高为qwen3.7-max-preview,综合榜第17名(1475分),代码榜第12名(1526分)。glm-5.1、ernie-5.1等国产模型排名相对稳定。AI模型claude-opus-4-7-thinkingclaude-fable-5Arena10 个信源在谈事件专题推荐理由:想快速了解本周最强AI模型?Arena周榜给出硬核排名:代码能力claude-opus-4-7-thinking超了claude-fable-5,国产qwen3.7也稳在Top20。原文稍后读已读值得跟进有用关注 claude-opus-4-7-thinking
03:03lmarena.ai@lmarena_aiFable 5模型重回LMSys Chatbot Arena,官方发布了一段蒙太奇视频,展示多个测试prompts。用户可以在Battle Mode和Agent Mode中直接体验该模型。官方排行榜分数即将公布,供社区参考。AI模型Fable 5ArenaBattle Mode10 个信源在谈事件专题推荐理由:Fable 5又回Arena了,还加了Agent模式,想自己动手测测看?直接去Battle Mode里玩,官方排名马上出。原文稍后读已读值得跟进有用关注 Fable 5
08:10lmarena.ai@lmarena_aiArena平台启动Claude Fable 5的Battle Mode和Agent Mode测试,覆盖文本、图像等多模态输入。用户可参与投票,直接影响最终排行榜分数。排行榜结果即将在arena.ai公布。该测试用于评估模型的多模态能力和智能体行为。AI模型Claude Fable 5ArenaBattle Mode10 个信源在谈事件专题推荐理由:Arena开始让大家测Claude Fable 5了,有Battle和Agent两种模式,你还能投票影响排名,快去试试。原文稍后读已读值得跟进有用关注 Claude Fable 5
21:19IT之家(博客/媒体)72°AI 模型评测平台 Arena(前身 LMArena)的企业级服务 AI Evaluations 上线仅 8 个月,年度经常性收入突破 1 亿美元(约 6.8 亿元人民币)。Arena 最初为加州大学伯克利分校 2023 年启动的研究项目,2025 年 4 月公司化,9 月推出商业产品。而另一评测平台 Yupp 因未找到产品市场契合点,于 2025 年 3 月 31 日停止运营,其累计用户超过 130 万。行业ArenaAI Evaluations模型评测推荐理由:Arena 从用户投票排行榜做到商业产品,8 个月年收入破亿,说明模型评测确实能赚钱。对比 Yupp 的关停,看看差异化在哪。原文稍后读已读值得跟进有用关注 Arena
12:19lmarena.ai@lmarena_aiArena 是一个从 UC Berkeley 研究项目起步的 AI 评估平台。推出评估产品仅8个月后,其年化收入运行率突破1亿美元。平台推出 Agent Arena,用于评估长期运行的智能体在复杂现实任务中的表现,包括工具使用、任务完成率和幻觉率。目前 Arena 拥有数千万用户。AI产品ArenaAgent ArenaUC Berkeley推荐理由:Arena 8个月做到1亿美元年收入,它的 Agent Arena 能测 AI 智能体在真实任务里的表现,比传统投票评测更硬核。原文稍后读已读值得跟进有用关注 Arena
03:55lmarena.ai@lmarena_ai精选Arena排行榜基于全球社区的真实任务动态更新,而非静态基准。评估流程包括内部基准测试、模型接入、社区投票、分数稳定化和公开发布。团队采用Bradley-Terry模型确保分数稳定性,并区分Expert和Hard难度以细化评估维度。视频还介绍了代码名称、身份泄露过滤及投票质量控制等机制。技巧ArenaLMSYS模型评测推荐理由:想了解AI模型评测怎么运作的?Arena团队亲自拆解从内测到上线的完整评估流程,还讲了Bradley-Terry分数如何保证公平,干货满满。原文稍后读已读值得跟进有用关注 Arena
10:40lmarena.ai@lmarena_ai精选GLM-5.2 (Max) 在 Arena 榜单上整体排名第10,较之前上升4.4%。工具幻觉指标并列第1,提升1.9%。确认任务成功排第3,提升9.4%。赞比投诉排第3,提升14.9%。Bash 恢复排第16,提升1.7%;可操控性排第20,下降6.0%。AI模型GLM-5.2Arena工具幻觉推荐理由:GLM-5.2 (Max) 在工具幻觉和任务成功率上表现突出,综合排名上升4.4%,值得看看它在这些指标上的优势。原文稍后读已读值得跟进有用关注 GLM-5.2
12:59lmarena.ai@lmarena_ai83°Arena 宣布已移除 Claude Fable 5,原因是 Anthropic 的最新公告和美国政府指令要求暂停访问。Fable 5 在 Agent、Text 和 Code Arena 三项基准中均排名第一,是 Arena 测试过的最强模型,在 Agent Arena 上以最大领先幅度超过 Opus-4.8 和 GPT-5.5。该模型在确认任务成功率和好评/投诉比两项关键信号上表现突出,但可操控性较弱。Arena 表示将在可能时恢复访问并重启社区测试。行业Claude Fable 5AnthropicArena10 个信源在谈事件专题推荐理由:最强模型被下架,原因值得关注原文稍后读已读值得跟进有用关注 Claude Fable 5
03:21lmarena.ai@lmarena_aiArena 平台推出全新的 Agent Mode,并已将 Mistral 3.5 模型纳入其中。该模式允许模型执行深度研究、生成报告、创建网站、调试代码等复杂任务,通过调用网页搜索、沙箱环境 bash、图像生成、文件写入等工具完成。用户可亲自测试包括 GPT-5.5、Claude Opus 4.7、Gemini 3.1 Pro 及顶级开源模型在内的前沿模型。用户的测试会话将帮助塑造 Agent Arena 排行榜,为评估智能体能力提供真实场景数据。AI产品Mistral 3.5ArenaAgent Mode推荐理由:Arena 的 Agent Mode 让开发者能直接对比主流模型在真实复杂任务上的表现,做智能体应用选型的团队值得亲自上手测试,结果会直接影响排行榜。原文稍后读已读值得跟进有用关注 Mistral 3.5
06:16lmarena.ai@lmarena_ai88°Arena 平台今日正式推出 Agent Mode,允许用户测试前沿模型在真实任务中的表现,包括深度研究、生成报告、创建网站、调试代码等。该模式通过工具调用(如网页搜索、沙箱 bash、图像生成、文件写入)完成复杂任务。首批支持的模型包括 GPT-5.5、Claude Opus 4.7、Gemini 3.1 Pro 及顶级开源模型。同时,Battle Mode 投票数已突破 5000 万。AI产品ArenaAgent Mode模型评测2 个信源在谈事件专题推荐理由:Arena 的 Agent Mode 让开发者可以直接对比前沿模型在真实任务中的表现,做 AI 评测或选型的团队值得一试。原文稍后读已读值得跟进有用关注 Arena
01:50lmarena.ai@lmarena_aiArena 团队发布了关于 Agent Mode 的详细博客,包含 FAQ 和早期使用经验。该模式旨在提升 AI 智能体的自主决策与任务执行能力。博客中分享了在实际应用中遇到的挑战与解决方案。对于关注 AI 智能体开发的团队和个人,这是一份有价值的参考。AI产品智能体Agent ModeFAQ推荐理由:做 AI 智能体开发的团队可以从中获取实际部署经验,FAQ 部分能直接解决常见问题,值得一读。原文稍后读已读值得跟进有用关注 智能体
01:49lmarena.ai@lmarena_aiArena 平台今日上线 Agent Mode,允许用户评估智能体 AI 的表现。该模式旨在为开发者提供测试和比较不同智能体系统的标准化环境。用户可通过 arena.ai/agent 直接体验。这标志着 AI 评估从单一模型转向更复杂的智能体交互场景。AI产品智能体评估平台Arena推荐理由:做智能体开发或选型的团队终于有了可量化的评估工具,建议直接上手试试 Agent Mode。原文稍后读已读值得跟进有用关注 智能体
11:07lmarena.ai@lmarena_ai精选76°MiniMax 发布开源权重模型 M3,首次在单一模型中融合编码、智能体与多模态三大前沿能力。在 SWE-Bench Pro 上达到 59.0%,Terminal Bench 2.1 为 66.0%,并支持 1M 上下文长度。模型已上线 Arena 的文本、视觉、文档和代码竞技场,用户可投票评测。权重和技术报告将在约 10 天后公开。AI模型MiniMaxM3开源模型推荐理由:MiniMax M3 把编码、智能体和多模态塞进一个开源模型,做 AI 应用和 Agent 开发的团队可以直接在 Arena 上测效果,省去自己搭环境的时间。原文稍后读已读值得跟进有用关注 MiniMax
16:38AI Will@FinanceYF572°Arena.ai 宣布 Grok-Imagine-Video-1.5-Preview (720p) 在 Image-to-Video Arena 中排名第一,相比前代 Grok-Imagine-Video (720p) 提升了 52 分,超越了 Seedance-2.0 和 HappyHorse 等顶级模型。这是 xAI 在视频生成领域的重要突破,展示了 Grok 系列模型的持续进化能力。该模型在图像到视频的转换质量上取得了显著进步,为 AI 视频生成树立了新标杆。AI模型GrokxAI视频生成推荐理由:xAI 的视频模型首次登顶 Arena,做 AI 视频生成或内容创作的团队值得关注这个新选择,看看它能否在效果和速度上带来惊喜。原文稍后读已读值得跟进有用关注 Grok
14:14IT之家(博客/媒体)微软研究院发布 MAI-Image-2.5,这是其 MAI-Image 系列最强图像生成模型,在 Arena 文生图榜单升至第三。该模型重点增强了文字渲染能力,可胜任信息图、海报、包装等需要准确呈现文字的任务,同时在风格化插画、商业图像和视觉推理方面表现更稳定。用户已可在 Arena 体验,未来两周内将上线 MAI Playground 与 Foundry。AI模型微软MAI-Image-2.5图像生成推荐理由:做设计、营销或内容创作的团队终于有了更靠谱的商用级生图工具——文字渲染和视觉推理的提升让海报、包装这类需求不再翻车,建议直接去 Arena 试效果。原文稍后读已读值得跟进有用关注 微软
11:18lmarena.ai@lmarena_aiMAI-Image-2.5 是一款新的图像生成模型,将于下周在 MAI Playground 和 Foundry 平台上线。目前该模型已在 Arena 上提供公开早期访问,用户可以通过 arena.ai/image 链接体验。这一发布意味着开发者可以提前试用并评估模型能力,为后续集成做准备。AI产品MAI-Image-2.5图像生成Arena推荐理由:图像生成领域又添新选择,做 AI 图像应用或内容创作的开发者可以趁早访问 Arena 体验 MAI-Image-2.5 的实际效果,抢占先机。原文稍后读已读值得跟进有用关注 MAI-Image-2.5
12:01Geek@geekbb72°阿里巴巴通义千问团队发布了 Qwen 3.7 预览版,包括 Max 和 Plus 两个版本,已在 LMSYS Arena 上线。该模型在文本和视觉任务上表现强劲,使阿里在 Arena 文本榜单升至第6、视觉榜单升至第5。官方表示完整系列模型即将发布,值得期待。AI模型QwenArena多模态推荐理由:Qwen 3.7 预览版在 Arena 上表现亮眼,阿里排名大幅提升,做多模态或文本生成的应用开发者可以关注后续正式版发布。原文稍后读已读值得跟进有用关注 Qwen
11:46官方账号阿里云 Alibaba Cloud@alibaba_cloud72°阿里云宣布 Qwen3.7-Max-Preview 模型已上线 Arena 平台,在文本任务中排名第6。该模型是 Qwen3.7 系列的预览版本,预计正式版将很快发布。这一进展展示了阿里云在大语言模型领域的持续投入和竞争力提升。AI模型Qwen3.7阿里云大模型推荐理由:Qwen3.7 系列即将发布,关注国产大模型进展的开发者可以提前了解预览版表现,为后续集成做准备。原文稍后读已读值得跟进有用关注 Qwen3.7
08:39官方账号阿里通义 Qwen@Alibaba_Qwen76°阿里 Qwen 团队发布 Qwen3.7-Max-Preview 和 Qwen3.7-Plus-Preview 模型,已在 Arena 平台上线。在文本 Arena 中,Qwen3.7 Max Preview 综合排名第13,阿里成为第6大实验室;数学第7、专家第9、软件与IT第9、编程第10。在视觉 Arena 中,Qwen3.7 Plus Preview 排名第16,阿里升至第5。这标志着阿里在多模态能力上的显著进步,正式版 Qwen3.7 系列即将发布。AI模型Qwen3.7阿里Arena推荐理由:Qwen3.7 Preview 在数学和编程子项表现突出,做推理和代码任务的开发者可以关注正式版发布,值得一试。原文稍后读已读值得跟进有用关注 Qwen3.7
22:12lmarena.ai@lmarena_ai精选Arena 研究人员 Guanglei Song 和 I-Hung Hsu 在视频中详细介绍了 Arena 分类排行榜背后的数据管道:从 Databricks 和 Spark 作业到可插拔标签框架,调用 LLM 对文本、图像、前端编码等领域的每次评估进行分类。这个元数据层让 Arena 数据超越排行榜排名,对研究更有用。视频还涵盖了动态并发控制处理不稳定的 LLM API、无需重建系统即可添加新标签器、以及成本控制策略(过滤、幂等性和模型选择)。AI产品Arena数据管道LLM 评估推荐理由:Arena 的数据管道设计解决了大规模 AI 评估元数据管理的痛点,做评测平台或数据管线的团队可以直接借鉴其可插拔标签框架和成本控制思路。原文稍后读已读值得跟进有用关注 Arena