6月17日
10:40
10:40lmarena.ai@lmarena_ai
精选
GLM-5.2 (Max) 在 Arena 榜单上整体排名第10,较之前上升4.4%。工具幻觉指标并列第1,提升1.9%。确认任务成功排第3,提升9.4%。赞比投诉排第3,提升14.9%。Bash 恢复排第16,提升1.7%;可操控性排第20,下降6.0%。

推荐理由:GLM-5.2 (Max) 在工具幻觉和任务成功率上表现突出,综合排名上升4.4%,值得看看它在这些指标上的优势。
09:40
09:40Browser Use@browser_use
browser_use 团队开发的 BrowserCode 在 Odysseys 基准测试中拿下第一名。Odysseys 评估的是需持续数小时的 Web 工作流,涉及规划、记忆、推理和跨站验证。BrowserCode 展示了执行复杂长期任务的能力,例如自动订披萨。
推荐理由:browser_use 的 BrowserCode 在 Odysseys 上排第一,能自动处理订披萨这种好几个小时的网页任务,比一般浏览器助手强多了。
09:34
09:34Fireworks AI@FireworksAI_HQ
精选71°
GLM 5.2 已在 Fireworks 平台零日上线。该模型拥有 1M token 上下文窗口,定位为编码优先的前沿模型。其性能在 SWE-bench、Terminal-Bench、GPQA 和 AIME 等基准上得到独立验证。Fireworks 在智谱开源模型权重后立即在其基础设施上提供服务。
事件专题

推荐理由:Fireworks 第一时间上线了 GLM 5.2,百万 token 上下文很能打,编程基准表现不错,做开发的可以试试。
06:57
06:57官方账号Jim Fan@jimfan
在一项无法在物理世界中被攻破的基准测试中,OpenAI Codex 的表现超越 Anthropic Claude,而 Claude 又优于月之暗面 Kimi。该基准由 @DrJimFan 参与的论文提出,专注于物理世界的真实场景评估。结果显示了各模型在复杂物理任务上的相对排名。
事件专题

推荐理由:英伟达科学家发推说他们论文里 Codex 把 Claude 和 Kimi 都干掉了,还是物理世界实测,看看你家模型排第几。
06:28
06:28AK@_akhaliq
Data Journalist Agent是一个能将结构化数据自动转化为多模态报道的智能体,输出包括图表、文本和视频。它内置事实核查机制,每一条数据均可追溯原始来源。这个智能体旨在提升数据新闻的生产效率和可信度。
推荐理由:这个Data Journalist Agent能自动把数据做成带验证的图文视频报道,做数据新闻的不用手动整合多模态了
05:29
05:29elvis@omarsar0
精选
GLM-5.2 (Max)在Code Arena: Frontend榜单中排名第二,得分比Claude Opus 4.7 (Thinking)高29分,仅落后于Fable 5。该模型在React子榜单排第2,HTML排第4,且在品牌营销、参考设计等6个子类别中均位列第一。作为开源模型,GLM-5.2大幅领先Kimi-K2.6和Minimax-M3。
事件专题

推荐理由:智谱新模型GLM-5.2 Max在代码前端评测中杀到第二,直接压过Claude Opus 4.7,开源模型里目前最强,做前端开发的可以关注。
04:34
04:34Notion@NotionHQ
Notion 宣布在其平台上推出开放权重模型 GLM 5.2。该模型专门为长周期任务优化,通过 Baseten 提供服务。用户可直接在 Notion 中使用该模型,其权重公开可用于自定义部署。
事件专题

推荐理由:Notion 上多了个新模型 GLM 5.2,专搞长周期任务,通过 Baseten 提供服务,想试试开放权重模型的可以看看。
04:01
03:58
03:58lmarena.ai@lmarena_ai
GLM-5.2 (Max) 在 Text Arena 总榜排名第25位,与上一版本 GLM-5.1 水平接近。在 Expert Arena 和 Multi-Turn 子类别中取得较大进步。在生命科学、社会科学、创意写作和医学医疗等职业类别中表现提升。

推荐理由:智谱新模型 GLM-5.2 整体排名没变,但在专家问答和多轮对话上进步明显,写创意和医学内容更强了。
03:40
03:38
03:28
03:28lmarena.ai@lmarena_ai
Agent Arena 是一个智能体性能排行榜,现已在 arena.ai/leaderboard/ag... 上线。用户可通过按开放模型或按实验室(lab)筛选来查看详细数据。该排行榜为不同智能体模型提供了直接的性能对比基准。
推荐理由:想比对比不同智能体模型?去Agent Arena排行榜,能按开放模型或实验室筛选,帮你找到合适的。
03:05
03:05官方账号vLLM@vllm_project
精选
vLLM 发布 0.23.0 版本,为 Zai.org 的 GLM-5.2 模型提供 Day-0 支持。GLM-5.2 拥有 1M token 上下文窗口,专为长周期编码智能体设计,可承载从需求到部署的完整开发流程。该模型针对大规模代码实现、自动化研究和性能优化进行了调优,支持客户端和移动端内调试。用户即日起可通过 vLLM 运行该模型。

推荐理由:vLLM 刚发的 0.23.0 直接支持了 GLM-5.2,这个模型有 100 万 token 上下文,适合一口气写完整个项目代码,还能跨平台部署,写代码的可以试试。
03:05
03:04
03:04OpenRouter@OpenRouterAI
精选
Z.ai 发布 GLM-5.2 模型,采用 MIT 开源许可。该模型在编码和智能体任务上有显著提升,支持最长 1M 标记的上下文窗口。提供两种推理强度:GLM-5.2 (max) 追求极限性能,GLM-5.2 (high) 平衡性能与 token 效率。API 定价与 GLM-5.1 保持一致。
推荐理由:Z.ai 新出的 GLM-5.2 模型,编码和智能体能力大幅增强,还有 1M 超大上下文,而且开源!API 价格没涨,值得试试。
01:59
00:10
00:10Justine Moore@venturetwins
Ideogram 发布了名为 Ideogram 2.0 的开源权重图像模型,宣称在开放权重类别中排名第一。该模型体积足够小,可在消费级 GPU 上运行,但在设计任务上与 Nano Banana 和 GPT Image 竞争。研究团队由 @mo_norouzi 领导,分享了技术细节和观点。
推荐理由:Ideogram 这个开源权重图像模型能在普通显卡上跑,还能和 GPT Image 掰手腕,适合不想烧钱又想要好效果的人。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。