8月15日
02:05
02:05elvis@omarsar0
79°
Faraday是一个27B参数的智能体,基于Replica框架将论文复现转化为可扩展的强化学习任务。它调用编码agent作为工具,在held-out研究复现上击败了Claude Opus 4.8和GPT-5.5。奖励信号来自自动生成的rubric judge,与人类评估一致性高。论文已发布在arxiv.org/abs/2608.13331。
事件专题

推荐理由:一个叫Faraday的27B智能体,把论文复现变成强化学习任务,在测试集上赢了Claude Opus 4.8和GPT-5.5,还把编码agent当工具用,有点意思。
02:02
02:02官方账号阿里通义 Qwen@Alibaba_Qwen
阿里通义千问推出 Qwen3.8-27B 密集模型,定位本地 AI 开发。AMD 提供首日支持,可在 Ryzen AI Max+ 处理器或单张 Radeon AI PRO R9700 显卡上运行。开发者可通过 LM Studio 直接体验,并用 lemonade_server 将模型封装成应用。
事件专题

推荐理由:AMD 用户能第一时间在自家电脑上跑 27B 模型,用 LM Studio 就能玩,还能快速做成应用。
02:01
02:01官方账号阿里通义 Qwen@Alibaba_Qwen
Qwen3.8-2.4T-A95B已在DeepInfra平台上线。该稀疏MoE模型总参数达2.4万亿,激活参数为950亿,共512个专家。它面向编程、智能体工作流和复杂推理设计,原生支持262K上下文。API定价为每百万输入2美元、每百万输出6美元、缓存输入0.2美元。
推荐理由:DeepInfra上线了Qwen最新稀疏MoE模型,2.4T总参数只激活95B,专攻编程和智能体场景,价格也公布了,想试API的可以直接上手。
02:00
02:00官方账号阿里通义 Qwen@Alibaba_Qwen
78°
阿里开源了 Qwen3.8-2.4T-A95B,总参数 2.4T,每次推理激活 95B 参数。SiliconFlow 在发布当天即提供该模型的 API 服务。定价为输入每百万 token 2 美元、输出 6 美元、缓存输入 0.25 美元。该模型面向自主编程、深度研究和端到端智能体执行场景。
推荐理由:阿里 Qwen3.8 开源当天就能在 SiliconFlow 上直接调用,2.4T 参数输入才两美元每百万 token,写代码做研究都能一口气跑完。
01:43
01:43Aravind Srinivas@AravSrinivas
72°
Perplexity与OpenRouter联合推出了Web Search Benchmarks。该基准在openrouter.ai/benchmarks上公开,比较不同模型和配置下的搜索工具表现。Web Search Benchmarks的排名能帮助开发者决定如何为智能体(agent)配置搜索grounding。

推荐理由:Perplexity和OpenRouter发布了搜索基准,直接比较不同模型配搜索工具的效果,帮你决定智能体怎么接入搜索。
01:30
01:30官方一手歸藏(guizang.ai)@op7418
75°
智谱为 GLM-5.3 开源发布撰文,主张网络防御能力不应只属于少数大型机构。文中强调开源维护者、独立开发者和小型团队也需要这些工具,GLM-5.3 则大幅强化了网络安全任务能力。该发布由 Z.ai 推进。
事件专题

推荐理由:智谱马上要开源 GLM-5.3,这次重点补强网络安全任务,还专门说防御能力不该被大机构垄断,中小团队和独立开发者也能用上。
00:28
00:28官方账号阿里通义 Qwen@Alibaba_Qwen
78°
阿里Qwen团队发布Qwen3.8-Max,总参数2.4T、激活参数95B、上下文窗口1M。该模型为开源权重MoE,编码与智能体能力突出。Together AI作为Day 0发布伙伴,已同步上线推理服务。开发者现可直接在Together AI平台调用该模型。

推荐理由:Qwen3.8-Max刚发布就上了Together AI,2.4T参数的开源MoE,当天就能用,编码和智能体能力都挺强。
00:26
00:26官方账号阿里通义 Qwen@Alibaba_Qwen
76°
阿里开源Qwen3.8-27B,SGLang团队当天完成适配。在单张RTX 5090上,借助NVFP4和DSpark优化,解码速度达到206.1 tok/s。在DGX Spark上解码速度为38.28 tok/s。该模型在智能体规划和长时任务上表现突出。
事件专题

推荐理由:Qwen3.8-27B开源了,SGLang当天就能跑,单张5090能到206 tok/s,小模型之王回来了,试试吧。
00:25
00:25官方账号阿里通义 Qwen@Alibaba_Qwen
精选
阿里云发布 Qwen3.8-Max,即 2.4T-A95B 架构。即日起可通过 DigitalOcean Serverless Inference 调用,运行在 NVIDIA HGX B300 GPU 上。模型支持 1M token 上下文,专为长时程编码任务设计。用户按 API 用量付费,无需自建基础设施。
事件专题

推荐理由:阿里云把Qwen3.8-Max放上DigitalOcean了,1M上下文,写长代码直接调,按量付费不用管服务器。
00:19
00:19Aravind Srinivas@AravSrinivas
Z.ai正式发布GLM-5.3,基于743B参数的基座模型进行后训练。官方称其具备顶级编程与智能体能力,面向代码生成与Agent任务。同时宣布在网络安全领域实现重大提升,为开源模型设立新标准。技术细节已公布在官方博客。
事件专题

推荐理由:Z.ai拿743B大模型搞后训练,出了个GLM-5.3,能写代码还能搞网络防御,开源模型里不多见。
00:14
00:14elvis@omarsar0
GLM-5.3 由 Z.ai 发布,基于 743B 基础模型进行后训练强化。该模型在编程和智能体任务上表现突出,据称达到开源模型第一梯队。Z.ai 称其在网络安全领域树立了开源模型新标准。模型权重开放,开发者可自行部署测试。
事件专题

推荐理由:Z.ai 放出了开源模型 GLM-5.3,743B 大底子,编程和智能体能力很强,还主打网络安全,开源党可以试试。
8月14日
23:19
23:19小互@imxiaohu
75°
智谱发布 GLM-5.3,基座模型与 GLM-5.2 完全相同,所有改进均来自后训练。内部评测显示编程能力比 GLM-5.2 提升 50%,网络安全能力持平 Mythos 5。该模型已在 269 个开源项目中挖出 2436 个真实漏洞。
事件专题

推荐理由:智谱用同一套基座只做后训练,就把 GLM-5.3 的编程能力拉高了五成,还能在开源项目里挖出两千多个漏洞,挺值的看。
20:14
20:14小互@imxiaohu
OpenAI 发布 GPT-5.6 Sol。官方测试显示,该模型在“低”推理强度下的表现超过 GPT-5.5 在“高”推理强度下的水准。它能更敏锐地识别无效信息,减少不必要的循环推理,从而节省 Token 消耗,更快得到正确答案。
事件专题

推荐理由:OpenAI 的 GPT-5.6 Sol 在低推理强度下就超过了 GPT-5.5 的高推理强度表现,还更省 Token,你可以直接上手试试。
19:32
19:32Recraft@recraftai
Recraft推出V4.1版本,聚焦产品图拍摄场景。官方宣称首次生成即可达到生产就绪标准,无需二次调整。推文附带了提示词示例,帮助用户直接复用。该版本面向需要高质量产品图像的商业用途。

推荐理由:Recraft V4.1来了,专攻产品图,一次出图就能商用,省去反复调试,适合做电商和广告图的。
18:32
17:26
17:26官方一手歸藏(guizang.ai)@op7418
72°
智谱发布GLM-5.3,基于743B基础模型仅做后训练,未重新预训练。新版本重点提升安全能力,针对模型防御场景做了优化。长程任务执行显著增强,包括终端操作、工具调用及大型代码库修复。在开源模型中,其网络安全能力达到新水平。
事件专题

推荐理由:智谱发了GLM-5.3,没重新预训练就靠后训练把安全和长程任务拔高一大截,搞智能体或代码修复的值得看看。
17:23
15:14
15:14Geek@geekbb
Z.ai发布开源模型GLM-5.3,基于743B基础模型进行后训练。官方称其编码与智能体能力达到顶级水平,并在网络安全领域为开源模型树立新标准。社区讨论中,有网友希望其定价能压低Grok 4.6和DeepSeek V4 Pro。
事件专题

推荐理由:GLM-5.3开源发布了,743B后训练,主打编码和网络安全。蹲个价格,看它能不能背刺Grok和DeepSeek。
15:09
14:56
14:56ollama@ollama
Z.ai 发布开源模型 GLM-5.3,通过 743B 基础模型后训练实现顶级编码与智能体能力。该模型在网络安全领域设立新标准,成为开放模型的新标杆。Ollama 宣布将在其正式开放发布时提供支持,技术博客已公开细节。
事件专题

推荐理由:GLM-5.3 来了,743B 底座,编码和网络防御能力很强,Ollama 也已宣布支持,想试的可以直接上手。
14:32

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。