7月11日
17:35
17:35官方账号Decoder@Jonathan Kemper
北京人工智能研究院发布Orca世界模型,它预测抽象世界状态而非token或像素。该模型在125,000小时视频上训练,未使用任何动作标签。在五个机器人任务上,Orca的表现与专用π0.5模型相当。这项研究可能有助于缓解机器人领域长期面临的数据短缺问题。

推荐理由:中国团队搞了个Orca世界模型,不用学动作标签就能看懂视频里的世界,在五个机器人任务上跟专业π0.5打平,厉害。
16:25
16:25官方账号Greg Brockman@gdb
Box推出新型推理模型Sol,专为复杂推理与数据分析设计。Sol能分析数百页贷款交易文件,自动协调协议、财务、尽职调查和抵押品等材料中的条款。它会标记潜在风险点,并生成一份附带来源引用的分析报告保存至Box。该模型在文档密集型场景中大幅提升效率。
推荐理由:Box出了个叫Sol的模型,能一次读几百页贷款合同,自动比对条款找出矛盾,还帮你出带引用的报告,搞数据分析爽翻了。
16:07
16:07官方一手marktechpost@Asif Razzaq
蚂蚁集团旗下Robant发布LingBot-VA 2.0技术报告,这是为具身智能原生构建的视频动作基础模型,而非从视频生成器微调。模型通过Foresight Reasoning预测未来状态,并基于每个真实观测重新接底,实现225Hz异步控制。架构采用因果DiT、稀疏MoE视频流和语义视觉动作分词器。

推荐理由:蚂蚁Robant出了个面向具身AI的模型LingBot-VA 2.0,能预测未来状态并以225Hz实时控制,跟那些从视频生成器改的模型思路完全不一样。
15:19
15:19IT之家博客/媒体
73°
GPT-5.6 Sol 能充当“自动化研究员”,为较小模型 Luna 定制完整后训练方案。在内部评估套件“聚合 RSI”上,GPT-5.6 Sol 比 GPT-5.5 高出 16.2 个百分点。活跃研究员人均日 token 产出较 GPT-5.5 翻倍以上,单个研究员 pull request 和实验数量均上升。
事件专题

推荐理由:OpenAI 新出的 GPT-5.6 Sol 能自己训练小模型Luna,研究效率比上一代高16%,研究员一天干的活翻倍了。
12:11
11:23
11:23Aravind Srinivas@AravSrinivas
Perplexity 为 Enterprise 组织启用了 Grok 4.5 模型。面向 Consumer Pro 和 Max 订阅用户,Grok 4.5 可作为计算机编排模型。在 WANDR 基准上,Grok 4.5 得分高于其他五种编排配置。其成本约为 Opus 4.8 的一半。
事件专题

推荐理由:Perplexity 现在能用 Grok 4.5 做编排了,比 Opus 4.8 便宜一半,性能还更强,Pro 和 Max 用户快去试试。
11:02
09:43
09:43Fireworks AI@FireworksAI_HQ
精选74°
MiniMax AI发布M3内核,针对长上下文稀疏注意力中数据依赖块选择导致的内存访问瓶颈。M3采用KV-stationary设计,每个块仅读取一次。在B200 GPU上达到约980 TFLOP/s的算力。该方案有效提升长上下文推理效率。

推荐理由:MiniMax搞了个M3内核,KV-stationary让稀疏注意力在B200上跑到980 TFLOP/s,每个块只读一次,长上下文推理加速神器。
09:31
09:31官方账号Greg Brockman@gdb
OpenAI推出GPT-5.6,重点面向健康智能领域。GPT-5.6系列在整体性能提升的同时降低了成本。其中GPT-5.6 Luna在最高推理设置下超越GPT-5.5,但成本仅为后者的1/25。该模型使更多用户能够使用先进AI。
事件专题

推荐理由:OpenAI的GPT-5.6健康智能版来了,Luna比上一代强还便宜25倍,这波升级很实在。
08:32
08:03
08:03@koltregaskes@koltregaskes
71°
据传闻,Gemini 3.5 Pro 原定下周发布,但因检查点性能未达标而推迟数周。Google 需要大幅提升该模型,以应对 Fable 5、GPT-5.6、Grok 4.5 和 Meta Spark 等 SOTA 模型。在 Gemini 3.5 Pro 推出前,可能还会看到 GPT-6 和 Fable 5.1 等新模型。
事件专题

推荐理由:Google 的 Gemini 3.5 Pro 推迟了,对手们可没闲着,Fable 5、GPT-5.6 都在抢跑。看看这场竞赛有多激烈。
06:22
06:22官方账号Clement Delangue@ClementDelangue
精选
Hugging Face 与 Google Gemma 联合举办的 Gemma Challenge 结果出炉。超过100个 AI agent 和人类在6天内协作,将 Gemma 4 推理速度在单张 NVIDIA A10G GPU 上提升5倍,达到491.8 TPS(最快但有质量损失),无损方案达315 TPS。项目展示了多智能体协作优化模型推理的潜力。
事件专题

推荐理由:Hugging Face 和 Google 搞了个挑战赛,100多个 AI agent 和人类一起把 Gemma 4 推理速度在单张 A10G 上提升了5倍,最快冲到491.8 TPS,挺酷的。
05:58
05:58Aravind Srinivas@AravSrinivas
精选
Perplexity CEO透露其自研编排器架构,基于GLM 5.2模型进行后训练。在需要时,系统会升级到Opus模型作为顾问。该编排器将利用更多计算资源快速提升质量。同时,Grok 4.5和Opus Fast也被认为是优秀的编排模型。
推荐理由:Perplexity CEO揭秘自家搜索背后的模型编排:用GLM 5.2后训练,必要时上Opus,比Grok 4.5和Opus Fast还强?
05:37
05:37官方账号OpenAI@OpenAI
OpenAI 发布 GPT-5.6,聚焦健康智能领域。其中 GPT-5.6 Luna 在最高推理设置下性能超越 GPT-5.5。同时推理成本降低 25 倍。这些改进旨在提升模型质量并降低使用门槛,让更多人能够用上先进模型。
事件专题

推荐理由:OpenAI 新出的 GPT-5.6 Luna 性能比 GPT-5.5 强,还便宜 25 倍,搞健康智能的可以看看。
05:16
05:16Paul Couvert@itsPaulAi
过去72小时内,OpenAI发布了GPT-5.6,SpaceXAI推出了Grok 4.5,Muse发布了Spark 1.1,Meta推出了Muse图像/视频模型,OpenAI还发布了GPT-Live,Mistral推出了Robostral Navigate。这6款新模型/产品覆盖语言、图像、导航等多个方向。
事件专题

推荐理由:这两天AI圈太热闹了,OpenAI、SpaceXAI、Meta一口气发了6个新模型,包括GPT-5.6和Grok 4.5,值得一看。
04:52
04:52官方账号Greg Brockman@gdb
Ethan Knight宣布GPT-5.6 Sol Ultra在64个子智能体协作下,仅用不到1小时就证明了50年未解的Cycle Double Cover Conjecture。该猜想是图论中的经典问题,此前无人能解。团队公开了提示词和完整证明过程,展示了大规模智能体协同推理的潜力。
推荐理由:Sol Ultra刚发布就搞定了困扰数学界50年的猜想,64个AI一起发力,效率惊人。想看看提示词和证明?直接去翻原文。
03:08
03:08官方账号Decoder@Matthias Bastian
76°
OpenAI的GPT-5.6 Sol模型独自对较小的Luna模型进行了后训练微调,触发方式仅为一个“相当不明确的提示词”。在OpenAI内部的RSI(递归自我改进)基准测试中,Sol的得分比GPT-5.5高出16.2分。OpenAI表示,这一进展让“自动化研究员”目标更加接近现实。
事件专题

推荐理由:OpenAI又搞事情了:GPT-5.6 Sol用一句模糊指令就能自动调教出更强的Luna,性能比上一代飙升16分,自动化研究越来越近了。
02:45
01:37
01:37官方一手@OpenAIDevs@OpenAIDevs
73°
OpenAI推出了GPT-5.6模型,并将Codex直接集成到ChatGPT中。开发者在7月10日上午9:30-10:30 PT可通过Reddit r/Codex AMA提问。GPT-5.6在代码生成和推理能力上有显著提升,Codex内置后可在聊天界面直接运行代码。AMA将涵盖GPT-5.6、Sites、computer use等新功能。
事件专题

推荐理由:OpenAI刚发了GPT-5.6,还把Codex塞进了ChatGPT,开发直接能用。想了解新特性和实战技巧?赶紧去Reddit AMA蹲点提问。
01:02
00:10
00:10官方账号LangChain@LangChainAI
精选
LangChain 团队将 NVIDIA 的 Nemotron 3 Ultra 接入 agent 框架 Deep Agents 进行调优。他们通过特定的训练和推理优化,提升了模型在复杂任务中的表现。调优后的 Nemotron 在多个 benchmark 上取得进展,展示了开源模型在智能体场景下的潜力。
事件专题

推荐理由:LangChain 分享了怎么用 Deep Agents 调优 Nemotron 3 Ultra,有具体方法,做 agent 的可以看看。
7月10日
23:16
22:15
22:15官方账号LMSYS Org (SGLang)@lmsysorg
精选
Netpreme发布博客,介绍将X-Mem MPU插入SGLang HiCache的分层KV缓存方案。在SWE-bench的Claude Code多轮编码中,前缀缓存命中率平均达98%。用X-Mem替换主机DRAM作为卸载层级后,TTFT降低6.7倍,每用户TPS提升33-50%,系统吞吐量提升30%。该方案通过HiCache的分层接口实现即插即用。

推荐理由:Netpreme的X-Mem内存插进SGLang的HiCache,多轮对话缓存带宽不再是瓶颈,TTFT降6.7倍,吞吐量涨30%,实测SWE-bench效果显著。
19:58

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。