22:29官方一手Hugging Face: Blog(博客/媒体)精选76°IBM Research 在 Hugging Face 上推出了 Open Agent Leaderboard,这是一个用于评估 AI 智能体性能的公开排行榜。该排行榜通过一系列标准化任务测试智能体的规划、工具使用和推理能力,旨在为开发者提供可复现的基准。目前已有多个主流模型参与评测,包括 GPT-4、Claude 等。这一举措有助于推动智能体领域的透明化和标准化,让开发者能更直观地比较不同智能体的实际表现。行业智能体排行榜IBM推荐理由:智能体评估一直缺乏统一标准,IBM 这个排行榜让开发者能直接对比不同模型的规划与工具使用能力,做智能体应用的团队值得关注。原文稍后读已读值得跟进有用关注 智能体
01:41berryxia@berryxiaSlides Arena 发布了基于 370 万+ 真实创作者使用场景的 Agentic Slides 排行榜,Anthropic 的 Opus 4.7 包揽前两名,智谱的 GLM 5.1 位列第三。该排行榜基于真实世界的幻灯片生成场景,强调逻辑、创意和设计感,而非实验室 benchmark。结果显示 Claude 在 Agentic 设计领域仍具领先优势,但 GLM 表现亮眼。AI产品GLMOpusAgentic Slides10 个信源在谈事件专题推荐理由:做 PPT 设计或 Agentic 内容生成的团队,这份基于 370 万真实场景的排行榜值得参考——GLM 5.2 能紧追 Opus 4.7,说明国产模型在创意密集型任务上已有竞争力,建议点开看看完整榜单。原文稍后读已读值得跟进有用关注 GLM
15:02xiaomimimo@XiaomiMiMo73°小米MiMo-V2.5-Pro在最新Arena排行榜(2026年4月26日)中取得多项突破:在Text Arena专家级排名全球第6、开源模型第1,并在中国模型中排名第1,小米实验室整体排名全球第3,仅次于Anthropic和OpenAI。该模型在Text Arena综合排名中位列开源第2,在Code Arena网页开发排名中位列开源第3。此外,在Hard Prompts、指令遵循、长查询等4个子榜单中均获开源第1。这些成绩基于真实社区盲评,反映了模型的实际能力。AI模型小米MiMo-V2.5-Pro开源模型10 个信源在谈事件专题推荐理由:小米MiMo-V2.5-Pro在多个高难度榜单中超越众多闭源模型,做模型选型或关注开源生态的开发者值得关注——它证明了开源模型在核心智能和实际编码任务上已能媲美顶级闭源方案。原文稍后读已读值得跟进有用关注 小米
15:02kimi_moonshot@Kimi_MoonshotKimi K2.6 在 OpenRouter 的每周大语言模型排行榜中升至第一名。这一成绩反映了开发者社区对 Kimi 模型的认可和实际使用效果。Kimi 团队对开发者的支持表示感谢,并承诺将继续迭代优化。对于关注模型性能排名的开发者来说,这是一个值得关注的动态。AI模型KimiK2.6OpenRouter推荐理由:Kimi K2.6 在 OpenRouter 周榜登顶,说明它在实际使用中获得了开发者认可,做模型选型或对比的团队可以关注这个新选择。原文稍后读已读值得跟进有用关注 Kimi