7月28日
02:07
02:07Mustafa Suleyman@mustafasuleyman
Mustafa Suleyman宣布MAI-Cyber-1-Flash模型与MDASH多智能体安全框架结合,在CyberGym基准测试中得分96%。该成绩比Mythos模型高出12个百分点。推理成本仅为Mythos的一半。更多细节将在后续帖子中披露。

推荐理由:快看,MAI-Cyber-1-Flash在安全基准上拿96%,比Mythos高12个点还便宜一半,性价比炸裂!
01:48
01:47
01:47The Rundown AI@therundownai
78°
微软发布了其首个网络安全模型MAI-Cyber-1-Flash,在CyberGym漏洞基准测试中取得96%的分数。该分数比Anthropic的Mythos高12个百分点,且推理成本仅为后者的一半。微软AI CEO Mustafa Suleyman表示,token成本已成为防御方的真正约束。
事件专题

推荐理由:微软的新安全模型MAI-Cyber-1-Flash,比Anthropic Mythos高出12个点,成本还减半,搞网络安全的可以盯着。
01:41
01:41Y Combinator@ycombinator
77°
Claude Code 创始人 Boris Cherny 在 YC Startup School 2026 上分享 Opus 5 的独特之处,包括解决提示注入和删除 80% 系统提示。他解释了为何 Claude Code 要大幅精简系统提示,以及如何利用 Opus 5 运行数千个 AI 智能体。Cherny 认为编程问题已接近解决,但 CS 学生仍需掌握基础原理。
事件专题

推荐理由:Anthropic 的 Claude Code 之父 Boris Cherny 在 YC Startup School 上揭秘 Opus 5 的新特性,还分享了删除 80% 系统提示的实战经验。想了解下一代模型和 Agent 构建思路?这视频干货十足。
01:37
01:37Windsurf@windsurf_ai
Cognition 宣布 Kimi K3 模型已在 Devin Desktop 和 Devin CLI 中可用。在 FrontierCode 1.1 基准上,Kimi K3 是首个接近前沿性能的开源模型。该模型在代码任务上的表现接近闭源前沿模型。
事件专题

推荐理由:Cognition 把 Kimi K3 放进 Devin 桌面和终端了,在 FrontierCode 上接近前沿水平,开源模型里很能打。
01:23
01:23官方账号Clement Delangue@ClementDelangue
月之暗面(Moonshot AI)在 HuggingFace 平台上传了名为 Kimi 的模型,推文获得 2741 次查看。该模型开源后迅速引发社区关注,但目前尚未公布具体版本号或基准测试成绩。HuggingFace CEO Clement Delangue 转发该链接,进一步提升了话题热度。
事件专题

推荐理由:月之暗面把 Kimi 模型放到 HuggingFace 上了,做中文 NLP 的可以直接拿来用,不用自己训。
01:10
01:10Cognition@cognition_labs
精选
Cognition 发布 FrontierCode 1.1 Extended 基准,用于评估真实工程任务的合并性与质量。Kimi K3 在该基准上取得 58.2% 的得分和 63.6% 的通过率。在 Devin 环境下,Kimi K3 在复现漏洞和环境管理方面表现突出。该结果来自 devin.ai/blog/kimi-k3。
事件专题

推荐理由:Kimi K3 在真实工程任务基准上拿了 58.2%,而且在 Devin 里特别擅长修 bug 和管理环境,值得做开发的看看。
01:02
01:02Cognition@cognition_labs
Cognition 宣布 Kimi K3 现已集成到 Devin Desktop 和 CLI。在 FrontierCode 1.1 基准测试中,Kimi K3 是首个接近前沿性能的开源模型。这标志着开源编码模型达到了新的高度。
事件专题

推荐理由:Cognition 把 Kimi K3 放进 Devin 了,在 FrontierCode 上接近顶尖水平,而且是开源,想试最新的编码模型可以直接用。
01:00
01:00
00:18
00:18Fireworks AI@FireworksAI_HQ
72°
Kimi K3 在 Fireworks 平台上线,提供推理和训练服务。这是首个3万亿参数级别的开放前沿模型。它支持1M上下文窗口和原生视觉能力。其推理性能可媲美GPT-4o等顶级闭源模型。服务托管于美国且承诺零数据保留。
事件专题

推荐理由:Fireworks 上了首个3万亿参数的开放模型 Kimi K3,百万上下文加视觉,推理不输闭源,还零数据保留,上手试试。
00:15
00:12
7月27日
22:02
17:06
17:06官方一手歸藏(guizang.ai)@op7418
72°
Hugging Face为Moonshot AI的模型Kimi K3创建了一个开源预告倒计时页面。该页面显示即将开源的具体时间,目前尚在倒计时中。这暗示Kimi K3可能成为开源社区的又一新成员。
事件专题

推荐理由:Hugging Face专门给Kimi K3做了倒计时页面,说明这个模型马上要开源了,对开源模型感兴趣的可以蹲一下。
16:43
16:43官方账号ElevenLabs@elevenlabsio
ElevenLabs 宣布将于 10 月 6 日在印度班加罗尔举办首届峰会。会上将首次展示新语音模型,并深入探讨语音 AI 与智能体(Agent)的发展方向。活动还包括印度团队构建的语音优先 AI 产品的现场演示。这是 ElevenLabs 首次在亚洲举办大型技术峰会。
推荐理由:语音界大动作:ElevenLabs 要在班加罗尔开峰会,10 月 6 日首秀新模型,还有现场 Demo,搞语音和 Agent 的别错过。
11:45
10:59
10:59官方账号NVIDIA AI@NVIDIAAI
精选
NVIDIA在代理芯片设计场景中测试了Nemotron 3 Ultra的RTL编码能力。该模型迭代编写芯片逻辑代码、通过仿真器运行、读取失败并重写。在九个真实设计工作类别中,Nemotron 3 Ultra平均通过率达97.1%,每次迭代消耗6629个tokens。这是测试中所有开源模型里表现最好的。
事件专题

推荐理由:NVIDIA测了Nemotron 3 Ultra在芯片设计RTL编码上的表现,九类任务平均通过率97.1%,开源模型里最强,值得关注。
7月26日

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。