8月13日
17:48
17:48官方账号NVIDIA AI@NVIDIAAI
CodeRabbit与Baseten合作,用CodeRabbit自身的路由决策数据微调了NVIDIA Nemotron 3.5 Lightning。整个微调过程耗时不到3小时,花费低于100美元。微调后的模型相比此前的GPT级模型,准确率提升约4%,推理成本下降约50%。详细技术解析已发布在CodeRabbit官方博客。
事件专题

推荐理由:CodeRabbit用不到100美元和三小时微调了NVIDIA新模型,比原来的GPT级模型准确率高4%,推理成本还省一半,想省钱的可以看看。
17:47
17:47shao__meng@shao__meng
76°
马斯克在 X 上表示,Grok 4.7 将超过当前所有模型。他称 SpaceX 的训练语料独特,若存在真实工程能力更强的模型会感到惊讶。马斯克预计 Grok 4.7 将在一个月内发布。他还提到 Anthropic 是家很棒的公司,可能会很快发布更好的模型。
事件专题

推荐理由:马斯克给 Grok 4.7 背书,说工程能力无敌,还夸了 Anthropic,一个月内就发布,到时候看有没有被打脸。
17:47
17:46
17:46向阳乔木@vista8
博主@vista8 用与DeepSeek V4 Pro相同的提示词测试Grok 4.6。在一个打砖块游戏中,Grok 4.6设计出带熔炉故事场景的情节,音效表现也可圈可点。该模型还一次生成了60种Bento样式风格,其中部分样式的视觉效果优于DeepSeek V4 Pro。
事件专题

推荐理由:有人用同一组提示词跑Grok 4.6和DeepSeek V4 Pro,Grok在打砖块场景和Bento样式上都很惊艳,部分比DS 4 Pro还好看。
17:43
17:43
17:42
17:42官方账号NVIDIA AI@NVIDIAAI
72°
CrowdStrike 定制 NVIDIA Nemotron 3.5 Lightning,用于网络安全 agent 工作流。该模型达到分析师级准确率,训练速度更快、计算需求更低。它能自动关闭最高 88% 的良性检测,让安全团队专注真实威胁。
事件专题

推荐理由:CrowdStrike 用 Nemotron 3.5 Lightning 做了安全智能体,自动关掉 88% 误报,训练快又省算力。
12:40
07:20
07:20官方账号NVIDIA AI@NVIDIAAI
精选
NVIDIA 发布全新 MoE 模型 Nemotron 3.5 Lightning。distil labs 作为欧洲发布合作伙伴,对其进行了微调。该团队将微调版与 4 个可比 MoE 模型在 6 项任务上对比,未微调时排名第三,微调后跃居第一。完整数值与失败场景已公布在 distil labs 博客上。
事件专题

推荐理由:NVIDIA 的 Nemotron 3.5 Lightning 微调后,在 6 项任务上超过 4 个同类 MoE 模型拿了第一。想知道怎么调出来的,可以看这篇。
04:27
03:27
03:27
03:27官方一手歸藏(guizang.ai)@op7418
精选
SpaceX AI 发布 Grok 4.6 模型,官方称其达到前沿智能水平。相比 Grok 4.5,Grok 4.6 在相同价格下性能显著提升。定价为每百万输入 token 2 美元、每百万输出 token 6 美元。Twitter Premium+ 会员可通过 Grok Build 授权免费使用。
事件专题

推荐理由:想用前沿模型又嫌贵?Grok 4.6 比 4.5 强但价格不变,输入百万才 2 美元,Twitter 会员还能白嫖。
01:57
01:57Mustafa Suleyman@mustafasuleyman
精选76°
微软发布其首款推理模型 MAI-Thinking-1。该模型从零开始构建,而非基于现成架构。目前已在 Microsoft Foundry 平台上开放使用。团队负责人 Mustafa Suleyman 在 X 平台公布了这一消息。
推荐理由:微软自己从头搞了个推理模型 MAI-Thinking-1,已经放到 Foundry 里能用了,想试推理模型的可以去看看。
01:27
01:27宝玉@dotey
83°
DeepSeek V4 Pro 的 API 文档已上线,入口在 api-docs.deepseek.com 的中文快速开始页面。该页面面向开发者提供了模型接入指引。目前官方没有同步公布 V4 Pro 的基准测试数据。开发者可以通过文档开始尝试 DeepSeek V4 Pro 的接口调用。

推荐理由:DeepSeek 悄悄放出了 V4 Pro 的 API 文档,想抢先试新模型的开发者赶紧去 api-docs.deepseek.com 看看快速开始。
01:27
01:27官方账号Microsoft Research@MSFTResearch
精选
微软研究院发布MindTopo基准测试,专门检验AI模型对拓扑关系的理解能力。该基准通过路径、围栏、绳结等图形化任务,考察模型在空间推理和规划上的表现。MindTopo旨在发现当前模型在拓扑认知层面的短板,为后续改进提供测试依据。
推荐理由:微软出了个新基准MindTopo,专测AI懂不懂拓扑关系,像路径绕圈、绳结这种空间题,看看模型会不会犯晕。
00:27
00:27lmarena.ai@lmarena_ai
79°
xAI 推出 Grok 4.6,在 LMArena 的 WebDev 基准上以 1618 分排名第7。相较 Grok 4.5 的 1553 分(第13名)提升明显,且定价保持不变。目前 Grok 4.6 与 GPT-5.6 Sol xHigh(1622 分)和 Claude Fable 5(1627 分)仅差 4 到 9 分,三者同处第5至第7区间。
推荐理由:xAI 把 Grok 4.6 放出来了,网页开发能力直接冲到 LMArena 第7,跟 GPT-5.6 和 Claude 最新版就几分之差,这代提升挺猛。
8月12日
21:25
21:25OpenRouter@OpenRouterAI
精选73°
Meta Superintelligence Labs 推出首个开源权重模型 Muse Glimmer,已在 OpenRouter 上线。该模型为 30B 参数稠密文本+图像模型,采用 Apache 2.0 许可证。Muse Glimmer 在 MCP Atlas 基准上得分 75.5,在 SWE-Bench Pro 上得分 51.2,定位为可靠的本地智能体。
推荐理由:Meta 新出的开源模型 Muse Glimmer,30B 参数,Apache 2.0 随便用,本地跑智能体挺靠谱,MCP Atlas 和 SWE-Bench Pro 分数都不错,想玩本地 AI 的可以试试。
17:45
17:45AI Will@FinanceYF5
AI Agent在电脑操作基准测试中的成绩一年内从42%提升至85%,超过约72%的人类基准。这些Agent已从演示阶段进入真实业务场景。企业关注的重点已从Agent能否点击按钮,转向其能否稳定完成整份工作。
推荐理由:AI Agent操作电脑的成绩一年翻倍,已经超过七成人类,现在开始进企业干整份活了,看看它们到底行不行。
17:33
17:33官方账号阿里通义 Qwen@Alibaba_Qwen
精选
Qwen3.8-Max在Legal Research Bench上的得分在不到三个月内几乎翻倍,排名从第22位跃升至第4位。Vals AI在推文中强调了这一进步,并附上了相关链接。该模型在基准测试中的显著提升展示了其在法律研究领域的性能增强。
推荐理由:Qwen3.8-Max在Legal Research Bench上从第22冲到第4,三个月内得分翻倍,看看它怎么做到的。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。