16:02官方一手marktechpost@Asif Razzaq精选NVIDIA推出开源MoE模型Nemotron 3.5 Lightning,总参数量30B,激活参数仅3B,专为智能体执行层设计。同时发布NeMo Switchyard模型路由器,可将每个执行步骤路由到成本最低且能力足够的模型。该组合旨在降低智能体推理成本,提升执行效率。Nemotron 3.5 Lightning基于开源许可发布,开发者可自由使用。AI模型NemotronNVIDIAMoE10 个信源在谈事件专题推荐理由:NVIDIA开源了30B MoE,激活才3B,跑起来便宜,还配了个路由器帮你省钱,搞智能体的可以看看。原文稍后读已读值得跟进有用关注 Nemotron
07:36IT之家(博客/媒体)CoreWeave 发布 2026 财年第二财季财报,营收 25.75 亿美元,同比增长 112.46%,超出市场预期。上半年营收达 46.53 亿美元,同比增长 112.08%,但归母净利润亏损 13.66 亿美元,同比扩大 125.79%。公司收入储备订单达 1040 亿美元,主动算力规模扩张至 1.5 GW。CoreWeave 完成行业首次 NVIDIA Vera Rubin NVL72 启动验证,并获 Jane Street 10 亿美元战略投资。公司已被纳入纳斯达克 100 指数。行业CoreWeaveNVIDIAAI云服务4 个信源在谈事件专题推荐理由:AI 云巨头 CoreWeave 财报来了,营收翻倍但亏损也在扩大,订单储备 1040 亿美元,还搞定了 NVIDIA 新硬件,想了解 AI 基建行情可以看看。原文稍后读已读值得跟进有用关注 CoreWeave
04:05官方账号NVIDIA AI@NVIDIAAINVIDIA在发布Lightning模型的同时,推出了Nemotron-RL-Agentic-Terminal-Pivot数据集。该数据集是用于后训练编码智能体能力的开放智能体强化学习数据集。数据集已上传至Hugging Face平台,供开发者使用。论文NVIDIANemotron-RL-Agentic-Terminal-PivotHugging Face10 个信源在谈事件专题推荐理由:NVIDIA开源了训练编码智能体的数据集,想搞强化学习或智能体开发的可以看看。原文稍后读已读值得跟进有用关注 NVIDIA
03:46Aravind Srinivas@AravSrinivasNVIDIA推出Nemotron 3.5 Lightning,这是一款开放权重的30B MoE模型,仅3B参数激活,专为常驻智能体设计,可高效处理高吞吐、专业化任务。其输出速度比同类模型快4倍,能在笔记本或DGX Spark等本地硬件上流畅运行。用户也可通过Perplexity使用更大的Nemotron Ultra版本。AI模型Nemotron 3.5 LightningNVIDIAMoE10 个信源在谈事件专题推荐理由:NVIDIA新出的开源MoE模型,30B参数但只激活3B,笔记本就能跑,速度还快4倍,做智能体任务很合适。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
03:02Harrison Chase@hwchase17LangChain创始人Harrison Chase在X上表示,对NVIDIA发布的Nemotron 3.5 Lightning模型感到兴奋,并计划将其集成到deepagents框架中。NVIDIA CEO黄仁勋称该模型为连续和长期运行智能体设计,具备智能、快速、高效且开源的特点。该模型旨在提升智能体的持续运行能力,可能对AI代理生态产生重要影响。AI模型Nemotron 3.5 LightningNVIDIALangChain10 个信源在谈事件专题推荐理由:LangChain创始人亲自下场点赞,还要集成到deepagents里,说明Nemotron 3.5 Lightning对智能体开发是真有用,搞AI代理的可以关注下。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
02:29ollama@ollamaOllama宣布与NVIDIA及黄仁勋团队合作,共同推出开源模型Nemotron 3.5 Lightning。该模型主打智能、快速、高效,并保持开源特性,旨在支持持续运行的智能体。双方强调开放模型无边界,未来将继续合作推动生态发展。AI模型OllamaNVIDIANemotron 3.5 Lightning10 个信源在谈事件专题推荐理由:Ollama和NVIDIA联手了,新出的Nemotron 3.5 Lightning主打快和高效,还是开源的,做智能体可以试试。原文稍后读已读值得跟进有用关注 Ollama
01:10官方账号LangChain@LangChainAI精选LangChain在Deep Agents评测套件中测试了NVIDIA开源路由器Switchyard,该套件包含145个多步任务,覆盖工具使用、检索、文件系统操作和长上下文场景。结果显示,93%的调用被路由到30B模型,仅7%需要Claude Opus 4.8。通过路由策略,总成本降低约70%,同时保留了Opus约90%的准确率。LangChain已推出与Switchyard的deepagents集成。AI产品SwitchyardNVIDIALangChain10 个信源在谈事件专题推荐理由:想知道你的智能体能不能少花点钱?LangChain实测NVIDIA的Switchyard,93%任务用30B模型搞定,成本砍七成,准确率还保住九成。原文稍后读已读值得跟进有用关注 Switchyard
00:46ollama@ollama精选NVIDIA 的 Nemotron 3.5 Lightning 现已可通过 Ollama 本地运行。这是一款 30B 参数的混合专家模型,仅激活 3B 参数,支持 1M token 上下文。该模型专为常驻运行的智能体设计,擅长编码、工具调用和多轮对话。相比同类规模的开源模型,其吞吐量提升 4 倍,任务完成时间降低 30%。用户可通过 Claude Code、Hermes Agent 或 OpenClaw 等工具直接调用。AI模型Nemotron 3.5 LightningNVIDIAOllama10 个信源在谈事件专题推荐理由:NVIDIA 新出的 30B 模型,跑在本地,专门给常驻智能体用,速度快 4 倍,还支持 1M 上下文,搞智能体的可以试试。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
23:29Fireworks AI@FireworksAI_HQ精选NVIDIA 推出 Nemotron 3.5 Lightning,这是一款 30B MoE 模型,仅 3B 参数激活,专为高吞吐智能体任务设计。该模型从 Nemotron 3 Ultra 蒸馏而来,在 PinchBench 和 AA-Omniscience Non-Hallucination 基准上表现强劲。目前已在 Fireworks 平台上线,供开发者用于构建智能体工作流。AI模型Nemotron 3.5 LightningNVIDIAFireworks10 个信源在谈事件专题推荐理由:NVIDIA 新出的 30B MoE 模型,3B 激活参数跑得快,专为智能体场景优化,Fireworks 上直接能用。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
22:52官方账号NVIDIA AI@NVIDIAAI精选NVIDIA 推出 Nemotron 3.5 Lightning 模型,延续开放策略,公开权重、训练数据和配方。该模型已上线 Hugging Face 平台,开发者可自由获取和定制。Nemotron 3.5 Lightning 旨在提供高性能推理能力,适用于多种自然语言处理任务。此次发布进一步巩固了 NVIDIA 在开源模型领域的布局。AI模型NemotronNVIDIAHugging Face10 个信源在谈事件专题推荐理由:NVIDIA 把 Nemotron 3.5 Lightning 的权重、数据和配方全开放了,想自己改模型的话直接上 Hugging Face 就能拿,比闭源省事多了。原文稍后读已读值得跟进有用关注 Nemotron
22:43OpenRouter@OpenRouterAI精选NVIDIA Nemotron 3.5 Lightning已在OpenRouter上线。该模型为30B混合专家架构,仅激活3B参数,由Nemotron 3 Ultra蒸馏而来。它面向高容量、专业化的AI智能体工作负载,相比同类模型吞吐量最高提升4倍,任务完成速度最高快30%。AI模型NemotronNVIDIAOpenRouter10 个信源在谈事件专题推荐理由:NVIDIA新出的轻量MoE,30B参数只激活3B,跑智能体任务比同类快30%,想省算力可以试试。原文稍后读已读值得跟进有用关注 Nemotron
22:03官方账号NVIDIA AI@NVIDIAAI精选73°NVIDIA推出Nemotron 3.5 Lightning,一个30B参数的MoE模型,仅激活3B参数。该模型专为常驻智能体设计,可快速完成高并发、专业化任务。其输出速度比同类模型快4倍。模型已开源,适合需要高效推理的场景。AI模型NemotronNVIDIAMoE10 个信源在谈事件专题推荐理由:NVIDIA出了个30B MoE模型,只激活3B参数,跑得快4倍,适合做常驻智能体,开源可白嫖。原文稍后读已读值得跟进有用关注 Nemotron
22:02官方账号NVIDIA AI@NVIDIAAI精选NVIDIA推出Nemotron 3.5 Lightning,专为长时间运行的智能体工作流优化,覆盖工具调用、结果验证和任务委派等高频执行场景。该模型体积适中,可从DGX Spark到数据中心灵活部署。NVIDIA展示了其在DGX Spark上运行智能体工作流的实例,并提供了技术细节文档。AI模型Nemotron 3.5 LightningNVIDIA智能体10 个信源在谈事件专题推荐理由:NVIDIA新出的Nemotron 3.5 Lightning,专门为跑智能体高频调用工具的场景优化,体积小到能在DGX Spark上跑,适合做Agent开发的朋友看看。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
22:01官方账号NVIDIA AI@NVIDIAAI精选NVIDIA发布NeMo Switchyard,一个用于模型路由的开源库。该库允许在智能体工作流中为不同步骤选择不同模型,例如用前沿模型处理复杂推理和规划,用Lightning模型处理高容量、专业化执行。这能优化成本和性能。更多信息见官方链接。AI产品NVIDIANeMo Switchyard模型路由10 个信源在谈事件专题推荐理由:NVIDIA出了个新开源库,能让智能体工作流里不同步骤用不同模型,省钱又高效,搞Agent的可以看看。原文稍后读已读值得跟进有用关注 NVIDIA
08:46IT之家(博客/媒体)72°NVIDIA宣布与阿波罗、贝莱德、黑石、布鲁克菲尔德、高盛、KKR六家金融机构达成战略合作,共同打造可调动5000亿美元(约合3.38万亿元人民币)第三方资金的人工智能计算基础设施融资平台。该平台将NVIDIA生态系统的AI基础设施转变为可投资资产类别,为NVIDIA客户创建专属资金池。黄仁勋表示,部分情况下NVIDIA可能为项目提供最高达剩余价值25%的支持,帮助客户构建DSX人工智能工厂。行业NVIDIAAI基础设施融资3 个信源在谈事件专题推荐理由:NVIDIA拉上六家顶级金融机构搞了5000亿美元的算力融资平台,客户不用自己掏钱就能建AI工厂,黄仁勋说最多能出25%兜底。原文稍后读已读值得跟进有用关注 NVIDIA
00:35官方一手Hugging Face: Blog(博客/媒体)精选NVIDIA发布Magpie TTS,一个开放权重的多语言语音合成模型。该模型针对低延迟场景专门优化,适合部署实时语音代理。开发者通过开放权重可以完全控制部署流程,包括自定义推理配置。Magpie TTS支持多种语言,能用于构建跨语言交互系统。AI模型Magpie TTSNVIDIA语音合成10 个信源在谈事件专题推荐理由:NVIDIA把Magpie TTS开放权重了,能自己控制部署,低延迟跑多语言语音代理,比闭源API灵活。原文稍后读已读值得跟进有用关注 Magpie TTS
16:37IT之家(博客/媒体)Firebird于8月8日宣布在亚美尼亚赫拉兹丹投运CIS区域最大AI工厂,距动工仅半年多。该工厂基于NVIDIA的AI GPU与DSX平台,初期客户包括Perplexity AI。Firebird计划到2027年底在亚美尼亚部署300MW基础设施容量,对应超7万块Rubin和Blackwell GPU,并在哈萨克斯坦获得125MW容量。NVIDIA已计划对Firebird进行投资。行业FirebirdNVIDIAPerplexity AI3 个信源在谈事件专题推荐理由:Firebird在亚美尼亚开了个CIS最大AI工厂,NVIDIA都要投它,初期客户有Perplexity,明年还要上7万块Rubin和Blackwell。原文稍后读已读值得跟进有用关注 Firebird
04:43官方一手marktechpost@Asif RazzaqNVIDIA Labs开源了NOOA(NVIDIA Object-Oriented Agents),一个模型无关的Python智能体框架。以往智能体开发要分散在提示模板、工具schema、回调代码和工作流图里,NOOA把这一切压缩进单个Python类。在NOOA中,类方法就是模型可执行的动作,字段就是智能体状态,文档字符串就是提示词。开发者只需维护一个类,就能完成智能体的定义与运行。AI产品NVIDIANOOAPython1 个信源在谈事件专题推荐理由:NVIDIA开源了个叫NOOA的框架,写智能体变成写一个Python类,方法当动作、注释当提示词,省掉一堆配置文件。原文稍后读已读值得跟进有用关注 NVIDIA
11:05AI Engineer@aiDotEngineerAI Engineer World's Fair 2026 的 Local AI Track 已开始直播,由 NVIDIA 赞助,主题是“前沿智能正变成你拥有的东西”。首场 State of the Union 由 Joseph O'Fowa、Alex Ochema、Ahmad Osman 和 Matthew Berman 主讲。Osmantic 团队在 Desktop Frontier 环节讨论桌面端 AI,Local Models 环节由 Vincent Weisser 等探讨本地模型。Compression at the Edge 环节由 Daniel Han Chen 等讲解边缘压缩,Model Routing 环节由 Walden Yan 等讨论模型路由。全程可在这条推文附带的 YouTube 链接观看。行业AI Engineer World's Fair 2026NVIDIA本地模型7 个信源在谈事件专题推荐理由:AI Engineer 大会的 Local AI 专场正在直播,讲桌面端、本地模型、边缘压缩和模型路由,想围观最新方向就看这个。原文稍后读已读值得跟进有用关注 AI Engineer World's Fair 2026
07:44IT之家(博客/媒体)76°英伟达为应对HBM内存供应短缺,考虑降低Rubin Ultra GPU的HBM配置。据The Information援引3名知情人士,英伟达已测试至少3种低HBM配置,容量低于最初公布规格。TrendForce分析称,NVIDIA可能从HBM4E下调至HBM4,或将12Hi HBM降至8Hi。这一调整影响Rubin Ultra性能,但英伟达正从其他方面弥补。行业NVIDIARubin UltraHBM4E8 个信源在谈事件专题推荐理由:英伟达HBM不够用,Rubin Ultra可能要降配,从HBM4E降到HBM4。想了解性能缩水多少,看这个。原文稍后读已读值得跟进有用关注 NVIDIA
02:18AI Engineer@aiDotEngineer精选来自NVIDIA、Cognition和OpenRouter的三位代表,在一场视频对谈中剖析了模型路由的现状。他们讨论了何时在多个模型间切换、如何组合调用,并分享了各自的判断准则。OpenRouter作为实际的路由服务,提供了落地案例。这场讨论对NVIDIA生态下的AI工程师优化模型调用成本与效果有直接参考价值。技巧OpenRouterNVIDIACognition推荐理由:想搞明白什么时候该换模型、怎么把多个模型串起来用?看NVIDIA、Cognition和OpenRouter这几个人聊,比你自己摸索快。原文稍后读已读值得跟进有用关注 OpenRouter
17:25AI Will@FinanceYF578°NVIDIA宣布开源自动驾驶推理模型Alpamayo 2 Super。Alpamayo 2 Super能理解复杂场景,先思考再行动。Robotaxi、卡车和配送车是它的目标应用。模型采用OpenMDW-1.1协议开放商用。Jensen Huang表示下一代AI是机器人,从自动驾驶开始。AI模型NVIDIAAlpamayo 2 Super自动驾驶9 个信源在谈事件专题推荐理由:老黄开源的Alpamayo 2 Super是自动驾驶推理模型,能先思考再行动,Robotaxi和卡车都能用,而且协议允许商用。原文稍后读已读值得跟进有用关注 NVIDIA
16:22AI Will@FinanceYF576°英伟达今日发布面向自动驾驶的开源推理模型Alpamayo 2 Super。该模型在视觉之外增加了理解与推理能力,会先思考再行动。它被定位为Robotaxi、卡车、接驳车、物流车、拖拉机等车辆的通用骨干。英伟达以OpenMDW-1.1协议开放商用,允许团队检视、微调并部署。官方称开源模式有助于提升自动驾驶安全性。AI模型Alpamayo 2 SuperNVIDIA自动驾驶9 个信源在谈事件专题推荐理由:黄仁勋刚发布Alpamayo 2 Super,自动驾驶开源推理模型,先思考再行动,可商用,做车的团队值得看看。原文稍后读已读值得跟进有用关注 Alpamayo 2 Super
01:11官方账号NVIDIA AI@NVIDIAAI精选达索系统宣布采用NVIDIA的AI与GPU技术加速其仿真工作流。该合作将NVIDIA的高性能计算能力引入达索的工业模拟场景。用户可借助GPU并行计算提升复杂工程仿真的处理速度。行业NVIDIADassault SystèmesGPU8 个信源在谈事件专题推荐理由:达索系统把NVIDIA的GPU和AI用在了仿真上,算得更快,搞工业设计的可以关注。原文稍后读已读值得跟进有用关注 NVIDIA
16:32官方一手marktechpost@Asif Razzaq英伟达发布34B参数的开源视觉-语言-动作模型Alpamayo 2 Super,面向自动驾驶和Robotaxi场景。该模型采用32B Cosmos 3 Super Reasoner主干加2.3B扩散动作解码器,在LingoQA基准上得分79.2。它可在单次前向传播中输出轨迹、Chain-of-Causation因果链、元动作、自动标注和接地视觉问答。模型基于OpenMDW-1.1许可发布,允许微调、衍生和商业再分发。AI模型Alpamayo 2 SuperNVIDIAVLA10 个信源在谈事件专题推荐理由:英伟达这个34B开源VLA模型专攻自动驾驶,LingoQA拿79.2,还能商用改造,做Robotaxi的可以直接上手。原文稍后读已读值得跟进有用关注 Alpamayo 2 Super
10:44Latent.Space@latentspacepod作者在 @swyx 播客上复盘两个月前的争议言论,坚持认为 megakernels 已死。他的理由是内核复杂度太高,没有推理服务商会在生产中用 67k 行手工融合前向传播内核。他认为 GPU 内核优化是最适合强化学习的任务,AI 代理用 ncu CLI 和 MCP 就能自动调优。他还预测数据中心 Transformer 推理 ASIC 因架构未收敛而失败,NVIDIA 的护城河在于 HBM 容量带宽和软件工具链。行业megakernelsNVIDIAASIC9 个信源在谈事件专题推荐理由:一个工程师复盘自己的神预言:megakernels和推理ASIC都没戏,GPU调优会被RL接管,NVIDIA靠软件和HBM赢。原文稍后读已读值得跟进有用关注 megakernels
09:48IT之家(博客/媒体)英伟达发布开源自动驾驶模型 Alpamayo 2 Super,采用 Linux Foundation 的 OpenMDW-1.1 许可,支持商业使用、微调和衍生模型分发。该模型在 LingoQA 自动驾驶推理基准中排名第 1,Lingo-Judge 测试中领先 Qwen2.5-VL 72B 达 17.0 分,领先 Gemini 2.5 Pro 达 15.1 分。Alpamayo 2 Super 基于 NVIDIA Cosmos 3 Super Reasoner 构建,并通过强化学习后训练。系列中 Alpamayo 1.5 和 Alpamayo 1 作为低成本选项,适合云端开发和模型蒸馏。AI模型Alpamayo 2 SuperNVIDIAOpenMDW10 个信源在谈事件专题推荐理由:英伟达把能跑自动驾驶推理的 Alpamayo 2 Super 开源了,商用免费,LingoQA 评测第一,比 Gemini 2.5 Pro 高 15 分,搞车的开发者和车企可以直接拿去改。原文稍后读已读值得跟进有用关注 Alpamayo 2 Super
06:56官方账号Hugging Face@huggingface精选Open Secure AI Alliance 现有超过120个成员,Hugging Face 与 NVIDIA 均参与其中。该联盟发布新的开源安全贡献,包括拟议的 SAFE 指南。SAFE 指南旨在把机密的事件调查结果转化为跨生态系统的防护措施,改进审查、披露与管控流程。行业Open Secure AI AllianceHugging FaceNVIDIA10 个信源在谈事件专题推荐理由:安全联盟和 Hugging Face、NVIDIA 一起,把事故经验做成开源指南,120多家成员共享。原文稍后读已读值得跟进有用关注 Open Secure AI Alliance
03:59官方账号NVIDIA AI@NVIDIAAIDatabricks宣布加入Open Secure AI Alliance,该联盟由NVIDIA等多家行业领导者共同参与,旨在推动AI安全与安全研究的开放共享。Databricks将贡献其在数据治理、模型和智能体方面的能力,并提供安全、治理、红队测试和网络防御的开放工具。联盟的核心主张是,AI安全研究应基于开放系统,相关成果应公开分享。行业DatabricksNVIDIAOpen Secure AI Alliance10 个信源在谈事件专题推荐理由:Databricks和NVIDIA一起搞了个开放安全AI联盟,专注AI安全和红队防御,做企业AI的可以关注下。原文稍后读已读值得跟进有用关注 Databricks
02:16官方账号NVIDIA AI@NVIDIAAIFortanix宣布加入NVIDIA发起的Open Secure AI Alliance。该联盟旨在通过开放协作推动AI安全与安全计算。Fortanix将贡献其在机密计算领域的技术。联盟成员包括多家技术领导者。这次合作聚焦于AI安全和机密AI。行业FortanixNVIDIAOpen Secure AI Alliance9 个信源在谈事件专题推荐理由:Fortanix 加入了英伟达搞的 Open Secure AI Alliance,一起推 AI 安全和机密计算。做企业安全的可以关注下。原文稍后读已读值得跟进有用关注 Fortanix
02:14官方账号NVIDIA AI@NVIDIAAI76°NVIDIA发起的Open Secure AI Alliance成员数已突破120个。该联盟公开了新的开源安全贡献,其中包括新提出的SAFE指南。SAFE指南的目标是把机密事件发现转化为跨生态系统的更强保护。联盟认为,开放协作和快速行动是安全的关键。行业NVIDIAOpen Secure AI AllianceSAFE指南10 个信源在谈事件专题推荐理由:NVIDIA牵头的Open Secure AI Alliance已超120个成员,新公开SAFE指南,把事件经验变成开源防护,搞AI安全的可以看看。原文稍后读已读值得跟进有用关注 NVIDIA
00:58官方账号NVIDIA AI@NVIDIAAI精选NVIDIA Jetson AI Lab在X平台发布直播,主题为在Jetson上构建NemoClaw Agents。直播演示了在Jetson硬件上部署NemoClaw并搭建智能体的流程。该活动面向开发者,提供边缘端运行NemoClaw智能体的参考。技巧NemoClawJetsonNVIDIA4 个信源在谈事件专题推荐理由:NVIDIA官号直播教你在Jetson上搭NemoClaw智能体,想搞边缘Agent的可以看看。原文稍后读已读值得跟进有用关注 NemoClaw
21:53官方账号LangChain@LangChainAI75°LangChain宣布为其开源框架Deep Agents、LangGraph和LangChain新增韧性能力。这些功能允许智能体重试被中断的任务,并沿安全恢复路径继续执行。智能体可从已保存状态恢复,而无需从头开始。当主要模型不可用时,系统会自动回退到备选模型。此外,Open Secure AI Alliance已拥有超120个成员,并提出了SAFE指南草案。AI产品LangChainLangGraphDeep Agents10 个信源在谈事件专题推荐理由:LangChain给Deep Agents、LangGraph加了故障恢复,模型挂了自动换备用,中断也能续跑,搞Agent开发的可以看看。原文稍后读已读值得跟进有用关注 LangChain
15:38IT之家(博客/媒体)75°据IT之家引述韩国尤金投资与证券及TrendForce分析,NVIDIA正在评估下调明年Rubin Ultra AI GPU的HBM配置。可能的方案包括从HBM4E降至HBM4,或从12Hi HBM降至8Hi HBM,原因是三大DRAM原厂的HBM4E验证进度存在变量。等量HBM DRAM Die下,降低堆叠层数可产出更多HBM堆栈,在供应总量受限时支撑更多Rubin Ultra出货。TrendForce认为Rubin Ultra主要升级在I/O速率,因此更可能选择降低堆叠层数而非换代HBM4E。类似降配策略此前也出现在Vera CPU的LPDDR5X SOCAMM2上。行业NVIDIARubin UltraHBM4E7 个信源在谈事件专题推荐理由:英伟达下一代Rubin Ultra可能要降配HBM,12Hi HBM4E验证跟不上,改用8Hi也能多出货。原文稍后读已读值得跟进有用关注 NVIDIA
04:59官方账号NVIDIA AI@NVIDIAAI精选NVIDIA在AI Model Co-Design系列中发文指出,长上下文模型的推理速度在训练前就已被架构选择决定。随着上下文窗口扩大,注意力机制在推理成本中的占比快速上升,逐渐成为主要负担。文章梳理了4个决定性能上限的架构参数:group size、head dimension、KV-cache size和并行策略。这些选择同时影响系统吞吐量和单个用户的响应速度。技巧NVIDIA长上下文KV-Cache1 个信源在谈事件专题推荐理由:NVIDIA这篇博文把长上下文模型变慢的根源讲透了,训练前选对4个架构参数,服务成本能差很多。原文稍后读已读值得跟进有用关注 NVIDIA
01:05官方账号NVIDIA AI@NVIDIAAITeknium宣布Hermes Agent集成NVIDIA NeMo Relay,重点优化小型/本地模型性能。基于25万条对话记录的分析,优化涵盖工具执行时间、内存、任务回合数、schema上下文负载以及token效率。更新已推送,完整版本明天发布。AI产品Hermes AgentNeMo RelayNVIDIA6 个信源在谈事件专题推荐理由:本地模型跑Agent总嫌慢?Hermes Agent这次用上NeMo Relay,省token还少绕路,更新试试就知道。原文稍后读已读值得跟进有用关注 Hermes Agent
17:39IT之家(博客/媒体)TrendForce 预计 Alphabet、亚马逊、Meta、微软、Oracle 以及阿里巴巴、百度、字节跳动、腾讯今年的总体资本支出将突破 8867 亿美元,同比增长 90%。该机构预测 2027 年这部分资本支出将在高基数上再增长 49%,达到 1.32 万亿美元。TrendForce 还将 2026 年 AI 服务器出货量增幅预期从 28% 上调至 31%。上调依据包括美国超大型 CSP 对 NVIDIA 机架式方案采购意愿提升,以及谷歌、AWS 新一代 AI ASIC 下半年放量。行业TrendForce云服务供应商AI服务器6 个信源在谈事件专题推荐理由:云厂商今年要花8867亿美元建算力,TrendForce还把明年AI服务器出货增速调到31%,想了解行业风向可以看这个。原文稍后读已读值得跟进有用关注 TrendForce
08:54IT之家(博客/媒体)据市场分析报告,谷歌计划2028年部署1200万至1500万颗TPU v9芯片。该规模有望超过NVIDIA届时1240万颗AI GPU的出货预期。TPU v9将采用4计算裸片结构,对先进制程和封装产能需求更高。为此谷歌可能寻求台积电以外的代工来源,英特尔和三星或将获得订单。行业TPU v9GoogleNVIDIA5 个信源在谈事件专题推荐理由:谷歌要在2028年铺上千万颗TPU v9,直接对标NVIDIA,还拉英特尔三星抢代工,这盘棋够大。原文稍后读已读值得跟进有用关注 TPU v9
14:29官方一手marktechpost@Asif Razzaq英伟达开源Molt,一个基于PyTorch的智能体强化学习框架,核心RL代码约8.6K行。Molt以单个异步循环整合Ray、vLLM和NeMo AutoModel,让智能体保持普通Python实现,轨迹保持token级精确。吞吐量与基于Megatron的堆栈统计上相当。该框架旨在降低主流框架中算法修改需串联训练器、分布式后端和rollout胶水代码的工程成本。AI产品MoltNVIDIAPyTorch4 个信源在谈事件专题推荐理由:跑智能体RL想少折腾工程?NVIDIA开源Molt,8.6K行代码整合Ray与vLLM,效果比肩Megatron方案。原文稍后读已读值得跟进有用关注 Molt
03:20官方账号NVIDIA AI@NVIDIAAINVIDIA Research发布空间推理诊断基准Spatial-IQ,将3D物体计数拆分为九项感知与认知子任务。人类在该基准上计数准确率为82.1%,而最好的现成多模态模型仅达17.7%。针对子任务训练后,Qwen2.5-VL-32B的计数准确率从2.9%提升到62.6%。该基准可帮助研究者定位空间推理失败点并验证能力改进。AI模型NVIDIASpatial-IQQwen2.5-VL2 个信源在谈事件专题推荐理由:NVIDIA搞了个Spatial-IQ基准,把数箱子拆成九个子任务,Qwen2.5-VL练完后准确率从2.9%飙到62.6%,但离人类82.1%还远。原文稍后读已读值得跟进有用关注 NVIDIA