7月11日
16:25
16:25官方账号Greg Brockman@gdb
Box推出新型推理模型Sol,专为复杂推理与数据分析设计。Sol能分析数百页贷款交易文件,自动协调协议、财务、尽职调查和抵押品等材料中的条款。它会标记潜在风险点,并生成一份附带来源引用的分析报告保存至Box。该模型在文档密集型场景中大幅提升效率。
推荐理由:Box出了个叫Sol的模型,能一次读几百页贷款合同,自动比对条款找出矛盾,还帮你出带引用的报告,搞数据分析爽翻了。
12:11
11:23
11:23Aravind Srinivas@AravSrinivas
Perplexity 为 Enterprise 组织启用了 Grok 4.5 模型。面向 Consumer Pro 和 Max 订阅用户,Grok 4.5 可作为计算机编排模型。在 WANDR 基准上,Grok 4.5 得分高于其他五种编排配置。其成本约为 Opus 4.8 的一半。
事件专题

推荐理由:Perplexity 现在能用 Grok 4.5 做编排了,比 Opus 4.8 便宜一半,性能还更强,Pro 和 Max 用户快去试试。
11:02
09:43
09:43Fireworks AI@FireworksAI_HQ
精选74°
MiniMax AI发布M3内核,针对长上下文稀疏注意力中数据依赖块选择导致的内存访问瓶颈。M3采用KV-stationary设计,每个块仅读取一次。在B200 GPU上达到约980 TFLOP/s的算力。该方案有效提升长上下文推理效率。

推荐理由:MiniMax搞了个M3内核,KV-stationary让稀疏注意力在B200上跑到980 TFLOP/s,每个块只读一次,长上下文推理加速神器。
09:31
09:31官方账号Greg Brockman@gdb
OpenAI推出GPT-5.6,重点面向健康智能领域。GPT-5.6系列在整体性能提升的同时降低了成本。其中GPT-5.6 Luna在最高推理设置下超越GPT-5.5,但成本仅为后者的1/25。该模型使更多用户能够使用先进AI。
事件专题

推荐理由:OpenAI的GPT-5.6健康智能版来了,Luna比上一代强还便宜25倍,这波升级很实在。
08:32
08:03
08:03@koltregaskes@koltregaskes
71°
据传闻,Gemini 3.5 Pro 原定下周发布,但因检查点性能未达标而推迟数周。Google 需要大幅提升该模型,以应对 Fable 5、GPT-5.6、Grok 4.5 和 Meta Spark 等 SOTA 模型。在 Gemini 3.5 Pro 推出前,可能还会看到 GPT-6 和 Fable 5.1 等新模型。
事件专题

推荐理由:Google 的 Gemini 3.5 Pro 推迟了,对手们可没闲着,Fable 5、GPT-5.6 都在抢跑。看看这场竞赛有多激烈。
06:22
06:22官方账号Clement Delangue@ClementDelangue
精选
Hugging Face 与 Google Gemma 联合举办的 Gemma Challenge 结果出炉。超过100个 AI agent 和人类在6天内协作,将 Gemma 4 推理速度在单张 NVIDIA A10G GPU 上提升5倍,达到491.8 TPS(最快但有质量损失),无损方案达315 TPS。项目展示了多智能体协作优化模型推理的潜力。
事件专题

推荐理由:Hugging Face 和 Google 搞了个挑战赛,100多个 AI agent 和人类一起把 Gemma 4 推理速度在单张 A10G 上提升了5倍,最快冲到491.8 TPS,挺酷的。
05:58
05:58Aravind Srinivas@AravSrinivas
精选
Perplexity CEO透露其自研编排器架构,基于GLM 5.2模型进行后训练。在需要时,系统会升级到Opus模型作为顾问。该编排器将利用更多计算资源快速提升质量。同时,Grok 4.5和Opus Fast也被认为是优秀的编排模型。
推荐理由:Perplexity CEO揭秘自家搜索背后的模型编排:用GLM 5.2后训练,必要时上Opus,比Grok 4.5和Opus Fast还强?
05:37
05:37官方账号OpenAI@OpenAI
OpenAI 发布 GPT-5.6,聚焦健康智能领域。其中 GPT-5.6 Luna 在最高推理设置下性能超越 GPT-5.5。同时推理成本降低 25 倍。这些改进旨在提升模型质量并降低使用门槛,让更多人能够用上先进模型。
事件专题

推荐理由:OpenAI 新出的 GPT-5.6 Luna 性能比 GPT-5.5 强,还便宜 25 倍,搞健康智能的可以看看。
05:16
05:16Paul Couvert@itsPaulAi
过去72小时内,OpenAI发布了GPT-5.6,SpaceXAI推出了Grok 4.5,Muse发布了Spark 1.1,Meta推出了Muse图像/视频模型,OpenAI还发布了GPT-Live,Mistral推出了Robostral Navigate。这6款新模型/产品覆盖语言、图像、导航等多个方向。
事件专题

推荐理由:这两天AI圈太热闹了,OpenAI、SpaceXAI、Meta一口气发了6个新模型,包括GPT-5.6和Grok 4.5,值得一看。
04:52
04:52官方账号Greg Brockman@gdb
Ethan Knight宣布GPT-5.6 Sol Ultra在64个子智能体协作下,仅用不到1小时就证明了50年未解的Cycle Double Cover Conjecture。该猜想是图论中的经典问题,此前无人能解。团队公开了提示词和完整证明过程,展示了大规模智能体协同推理的潜力。
推荐理由:Sol Ultra刚发布就搞定了困扰数学界50年的猜想,64个AI一起发力,效率惊人。想看看提示词和证明?直接去翻原文。
02:45
01:37
01:37官方一手@OpenAIDevs@OpenAIDevs
73°
OpenAI推出了GPT-5.6模型,并将Codex直接集成到ChatGPT中。开发者在7月10日上午9:30-10:30 PT可通过Reddit r/Codex AMA提问。GPT-5.6在代码生成和推理能力上有显著提升,Codex内置后可在聊天界面直接运行代码。AMA将涵盖GPT-5.6、Sites、computer use等新功能。
事件专题

推荐理由:OpenAI刚发了GPT-5.6,还把Codex塞进了ChatGPT,开发直接能用。想了解新特性和实战技巧?赶紧去Reddit AMA蹲点提问。
01:02
00:10
00:10官方账号LangChain@LangChainAI
精选
LangChain 团队将 NVIDIA 的 Nemotron 3 Ultra 接入 agent 框架 Deep Agents 进行调优。他们通过特定的训练和推理优化,提升了模型在复杂任务中的表现。调优后的 Nemotron 在多个 benchmark 上取得进展,展示了开源模型在智能体场景下的潜力。
事件专题

推荐理由:LangChain 分享了怎么用 Deep Agents 调优 Nemotron 3 Ultra,有具体方法,做 agent 的可以看看。
7月10日
23:16
22:15
22:15官方账号LMSYS Org (SGLang)@lmsysorg
精选
Netpreme发布博客,介绍将X-Mem MPU插入SGLang HiCache的分层KV缓存方案。在SWE-bench的Claude Code多轮编码中,前缀缓存命中率平均达98%。用X-Mem替换主机DRAM作为卸载层级后,TTFT降低6.7倍,每用户TPS提升33-50%,系统吞吐量提升30%。该方案通过HiCache的分层接口实现即插即用。

推荐理由:Netpreme的X-Mem内存插进SGLang的HiCache,多轮对话缓存带宽不再是瓶颈,TTFT降6.7倍,吞吐量涨30%,实测SWE-bench效果显著。
19:58
18:52
15:51
15:51官方账号Greg Brockman@gdb
78°
GPT-5.6 with Work IQ 已上线微软 Copilot Chat、Cowork、M365 应用、GitHub 和 Foundry。该模型支持多步骤智能体工作、分析与内容创作,带来更强的推理能力和更高质量的输出,同时保持效率。Satya Nadella 在推特上确认了这一集成。
事件专题

推荐理由:GPT-5.6 来了,带着 Work IQ 直接进微软全家桶,Copilot、GitHub 都能用,推理更强还支持多步智能体任务,赶紧试试。
15:37
12:57
12:57AI Will@FinanceYF5
91°
OpenAI 发布了 GPT-5.6 系列模型,包含 Sol、Terra 和 Luna 三个版本。该系列已开始在 ChatGPT、Codex 和 API 中陆续上线,用户可逐步体验。OpenAI 尚未公布 Sol、Terra 和 Luna 的具体参数和定价细节。
事件专题

推荐理由:OpenAI 一口气发了三个 GPT-5.6 新模型,直接在 ChatGPT 和 API 里就能用,值得试试手感。
12:54

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。