01:42官方账号NVIDIA AI@NVIDIAAI精选NVIDIA AI 与 LangChain 联合推出基于 Nemotron 3 Ultra 的 Deep Agents 开源智能体框架。该 agent 在评测中取得 0.86 聚合分数,推理成本仅 4.48 美元。而性能最接近的闭源模型成本为 43.48 美元,实现了 10 倍的成本降低。框架完全开放可定制,开发者可直接使用。AI模型Nemotron 3 UltraLangChainDeep Agents10 个信源在谈事件专题推荐理由:NVIDIA 和 LangChain 搞了个开源智能体,用 Nemotron 3 Ultra 跑 Deep Agents,性能比肩闭源但成本只要 4 块多,比最接近的对手便宜 10 倍。搞 AI agent 的值得看看。原文稍后读已读值得跟进有用关注 Nemotron 3 Ultra
01:01官方账号LangChain@LangChainAI精选LangChain调整了NVIDIA Nemotron 3 Ultra模型的推理框架,在基准测试中获得0.86的聚合分数,成本仅4.48美元。与之性能最接近的模型成本为43.48美元,实现了10倍的成本降低。该优化在保持领先性能的同时大幅降低了推理开销。AI模型NemotronNVIDIALangChain10 个信源在谈事件专题推荐理由:LangChain让Nemotron 3 Ultra跑分0.86,成本只要4.48刀,比对手便宜近10倍,性价比拉满。原文稍后读已读值得跟进有用关注 Nemotron
23:41官方账号LangChain@LangChainAILangChain 与 NVIDIA 合作推出 NemoClaw Deep Agents Blueprint,这是一个完全开源的参考架构,用于构建企业级智能体系统。该架构在多个基准测试中取得领先性能,同时推理成本比传统方法降低超过 10 倍。它采用完全开放的软件栈,企业可以拥有并自定义代码。该蓝图旨在帮助开发者快速部署生产级智能体应用。AI模型NemoClawDeep AgentsLangChain10 个信源在谈事件专题推荐理由:LangChain 和 NVIDIA 搞了个开源的智能体参考架构,性能领先还便宜 10 倍成本,搞 agent 的可以看看。原文稍后读已读值得跟进有用关注 NemoClaw
23:37Harrison Chase@hwchase17精选LangChain与NVIDIA合作发布NemoClaw Deep Agents Blueprint,这是一个完全开源的企业级代理系统参考架构。该蓝图在基准测试中取得领先性能,同时推理成本相比现有方案降低超过10倍。企业可以完全拥有并自定义整个堆栈。AI产品NemoClawDeep AgentsLangChain9 个信源在谈事件专题推荐理由:LangChain和NVIDIA联手搞了个叫NemoClaw的开源代理系统,性能领先还便宜10倍以上,搞企业级AI代理的可以看看。原文稍后读已读值得跟进有用关注 NemoClaw
16:44IT之家(博客/媒体)NVIDIA 正与 ASIC 初创企业 d-Matrix 合作,将 Hopper/Blackwell GPU 与 d-Matrix 的 Corsair ASIC 结合形成混合算力基础设施。Parasail 通过该组合实现了 10 倍的 Token 生成速率。Corsair 采用台积电 N6 制程 D-IMC 架构,集成计算单元和足量 SRAM 降低数据开销。方案中 GPU 负责推理前端的预填充任务,Corsair 处理延迟敏感的解码任务。行业NVIDIAd-MatrixCorsair10 个信源在谈事件专题推荐理由:NVIDIA 和 d-Matrix 搞了个混合算力方案,GPU 负责预填充、专用芯片负责解码,推理 Token 生成速度翻了 10 倍。不是单纯的拼硬件,是真正分工优化。原文稍后读已读值得跟进有用关注 NVIDIA
15:19官方一手marktechpost@Sana Hassan精选本教程使用NVIDIA的cosmos-framework,在Colab上构建紧凑的Omnimodal Mixture-of-Transformers模型。该模型共享跨模态注意力,路由文本、视觉、动作各模态到专属专家。通过合成物理世界数据和自回归rollout,模型预测未来潜状态。教程展示了如何用小型版模拟Cosmos 3世界模型的核心能力。技巧NVIDIACosmos 3Omnimodal Mixture-of-Transformers3 个信源在谈事件专题推荐理由:NVIDIA发了个Colab友好教程,教你搭简化版Cosmos 3世界模型,用Omnimodal MoT架构实现跨模态预测,比跑全量模型省资源。原文稍后读已读值得跟进有用关注 NVIDIA
11:04IT之家(博客/媒体)74°英伟达发布NVIDIA Vera CPU,称其为可规模化单线程最强CPU。在智能体AI负载下,其单核持续性能是x86的1.8倍。相比NVIDIA Grace,自研Olympus核心每周期指令数高50%。Perplexity测试显示,Vera完成真实编码流程速度约为x86的1.5倍,并发沙箱启动速度最高为x86的1.9倍。合作伙伴测试中,Starburst SQL分析速度可达领先x86服务器的3倍,Redpanda实时流处理延迟最低降至1/6。AI产品NVIDIAVera CPU智能体6 个信源在谈事件专题推荐理由:英伟达的Vera CPU专为智能体AI打造,单核性能比x86强1.8倍,编码和数据库分析都更快,值得关注。原文稍后读已读值得跟进有用关注 NVIDIA
10:31官方账号NVIDIA AI@NVIDIAAI精选74°NVIDIA 开源了 NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 模型,总参数量 75.3B,激活参数 9.3B,采用 MoE 架构。该模型从 Nemotron-3-Super-120B 通过 Iterative Puzzle 框架压缩而来,支持 1M token 上下文长度。模型可运行在单张 GB10 显卡上。AI模型NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4NVIDIAMoE10 个信源在谈事件专题推荐理由:NVIDIA 刚开源的 75B MoE 模型,实际只激活 9.3B 参数,单卡就能跑百万 token 上下文,适合长文档或代码分析。原文稍后读已读值得跟进有用关注 NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4
08:54官方一手marktechpost@Asif RazzaqNVIDIA发布了Nemotron-Labs-Audex-30B-A3B(Audex)模型,这是一个混合专家(MoE)架构,统一了音频理解、语音识别、翻译、文本转语音和音频生成五种能力。该模型以Nemotron-Cascade-2为骨干,仅在音频任务上产生边际的性能回归。Audex在30B总参数中仅有3B活跃参数,高效实现了多模态融合。AI模型AudexNVIDIA多模态10 个信源在谈事件专题推荐理由:NVIDIA发了款新模型Audex,能同时搞定音频理解、语音识别、翻译、TTS和音频生成,而且几乎没牺牲原有文本模型的性能。原文稍后读已读值得跟进有用关注 Audex
07:54Aravind Srinivas@AravSrinivas71°Perplexity CEO Arav Srinivas表示,NVIDIA Vera CPU是专为agentic runtime定制的。Perplexity已与NVIDIA合作,在Vera CPU上运行其Perplexity Computer的沙箱基础设施,并观察到显著性能提升。Vera被描述为从规模上看单线程最强的CPU,适合agentic AI的序列执行,包括推理步骤、工具调用和代码执行。在系统满载时,每个agent步骤仍能保持快速。AI产品Vera CPUNVIDIAPerplexity6 个信源在谈事件专题推荐理由:Perplexity CEO说他们用NVIDIA的Vera CPU跑智能体性能提升明显,Vera是专为agent设计的单线程王者CPU。原文稍后读已读值得跟进有用关注 Vera CPU
07:45IT之家(博客/媒体)电源厂商海韵在官网电源瓦数计算器中新增了RTX 5080 SUPER、RTX 5070 Ti SUPER和RTX 5070 SUPER三款显卡选项。数据显示RTX 5080 SUPER TDP为415W,比RTX 5080的360W提升55W;RTX 5070 Ti SUPER TDP为350W,比RTX 5070 Ti的300W高50W;RTX 5070 SUPER TDP为275W,较RTX 5070的250W增加25W。三款显卡均将采用单颗3GB GDDR7显存,RTX 5080 SUPER和RTX 5070 Ti SUPER配备24GB,RTX 5070 SUPER升级至18GB。发布时间仍存不确定性,传闻最早2026年第三季度或推迟至2027年初。行业RTX 5080 SUPERRTX 5070 Ti SUPERRTX 5070 SUPER10 个信源在谈事件专题推荐理由:海韵官网泄露了NV三款SUPER显卡的功耗数据,RTX 5080 SUPER跑到415W,比非SUPER版高了55W,显存也升级到24GB,想买卡可以提前了解下功耗变化。原文稍后读已读值得跟进有用关注 RTX 5080 SUPER
04:28官方账号NVIDIA AI@NVIDIAAI精选NVIDIA Research提出MOTIVE方法,用于识别视频模型训练中对运动建模真正重要的片段。MOTIVE通过重新加权训练信号,聚焦运动区域、淡化静态背景,并依据对运动的影响程度为每个片段打分。仅用少量高影响子集微调,即可提升时序动态质量,在VBench动态性指标上显著提升,并以74.1%的人类偏好胜率优于基线模型。该工作获ICML2026杰出论文荣誉提名。AI模型MOTIVENVIDIA视频生成10 个信源在谈事件专题推荐理由:NVIDIA 发了新方法 MOTIVE,帮你从海量视频里挑出对运动建模最有效的片段来微调,效果比基座好很多。原文稍后读已读值得跟进有用关注 MOTIVE
02:16elvis@omarsar0精选NVIDIA发布论文,将混合MoE模型Nemotron-3-Super压缩为Puzzle-75B-A9B,活跃参数降至9B。在单个8xB200节点上,交互式服务器吞吐量约为原模型2倍。在H100 GPU上,1M token并发数从1请求提升至8。在推理、编程、长上下文和智能体基准上精度保持。该方法联合优化异构MoE剪枝、活跃参数预算和Mamba剪枝,结合蒸馏、强化学习、量化与多令牌预测头。AI模型Puzzle-75B-A9BNemotron-3-SuperMoE10 个信源在谈事件专题推荐理由:英伟达把大MoE模型压到9B活跃参数,吞吐量翻倍,智能体应用部署成本大幅下降,适合模型高效推理场景。原文稍后读已读值得跟进有用关注 Puzzle-75B-A9B
23:15官方账号NVIDIA AI@NVIDIAAI精选NVIDIA研究团队在ICML2026发表论文“Fast Autoregressive Video Diffusion & World Models with Temporal Cache Compression & Sparse Attention”。该方法通过时空缓存压缩和稀疏注意力解决自回归视频扩散中的注意力瓶颈。实验显示可实现5倍至10倍的推理速度提升,并在长序列生成中保持恒定内存占用。该工作同时适用于视频扩散模型和世界模型。论文NVIDIAICML2026视频扩散4 个信源在谈事件专题推荐理由:NVIDIA发的新论文,用时空缓存压缩和稀疏注意力,让视频扩散生成速度飙5-10倍,内存还不涨,搞视频生成和世界模型的朋友可以看看。原文稍后读已读值得跟进有用关注 NVIDIA
14:28IT之家(博客/媒体)71°英伟达与 Hugging Face 宣布合作,将 NVIDIA Isaac GR00T 1.7 机器人基础模型和 NVIDIA Isaac Teleop 远程操作框架接入 LeRobot 开源机器人库。后续计划引入 NVIDIA Cosmos 3 物理 AI 世界模型。此举连接英伟达的 300 万机器人开发者与 Hugging Face 的 1600 万 AI 开发者。LeRobot 已接入的开源物理 AI 数据集包含超过 35 万条真实与模拟轨迹及 5700 万次抓取数据。AI模型NVIDIAHugging FaceLeRobot10 个信源在谈事件专题推荐理由:英伟达和 Hugging Face 把机器人基础模型和远程操作框架接入了开源库 LeRobot,还计划加入 Cosmos 3,海量数据集也能直接用。原文稍后读已读值得跟进有用关注 NVIDIA
01:11官方账号NVIDIA AI@NVIDIAAI精选在 ICML 2026 上,NVIDIA 的 Nemotron 模型和数据集被 145 篇论文引用。NVIDIA 自身有 74 篇论文被接受,约 2000 篇论文引用了 NVIDIA GPU。这些数据体现了 NVIDIA 在 AI 研究中的基础设施地位。Nemotron 作为开放模型正在成为现代 AI 研究的基础。AI模型NVIDIANemotronICML8 个信源在谈事件专题推荐理由:NVIDIA在ICML 2026上刷了一波存在感:145篇论文用上Nemotron,74篇自家论文入选,还有2000篇靠NVIDIA GPU跑出来的。学术圈地位一览无余。原文稍后读已读值得跟进有用关注 NVIDIA
00:11官方一手marktechpost@Asif RazzaqNVIDIA 发布 HORIZON 框架,一种免手动代理,通过 Git Worktrees 将每个 RTL 问题作为版本化仓库托管。该框架在多个 RTL 基准测试中达到 100% 完成率,无需人工干预。HORIZON 自动迭代设计、验证和修复硬件描述代码,显著提升芯片设计效率。AI模型NVIDIAHORIZONRTL2 个信源在谈事件专题推荐理由:NVIDIA 新出的 HORIZON 代理,能自动搞定 RTL 设计,基准测试全通过,做芯片验证的可以看看。原文稍后读已读值得跟进有用关注 NVIDIA
14:38官方一手marktechpost@Asif RazzaqNVIDIA 发布了 ASPIRE 自改进机器人框架,能自动编写并优化机器人控制程序。该框架在 LIBERO-Pro 长任务上实现 31% 零样本成功率,并通过迭代修复将性能提升最多 77 点。ASPIRE 还能将已验证的修复技能蒸馏为可复用的技能库,支持零样本迁移到未见过的长时任务。AI模型NVIDIAASPIRE机器人4 个信源在谈事件专题推荐理由:NVIDIA 搞了个新框架 ASPIRE,自己写程序自己修,LIBERO-Pro 长任务零样本就 31%,还能再提 77 点,做机器人的可以看看。原文稍后读已读值得跟进有用关注 NVIDIA
10:14官方账号LMSYS Org (SGLang)@lmsysorgLM-SYS在推文中强调软件是AI基础设施的复合力量。他们指出开源意味着每一份进步都能惠及所有人。该组织自豪地基于NVIDIA CUDA原生构建。行业LM-SYSNVIDIACUDA6 个信源在谈事件专题推荐理由:LM-SYS说软件才是核心,开源能让每个人受益,还特意cue了NVIDIA CUDA。观点很直白。原文稍后读已读值得跟进有用关注 LM-SYS
23:29官方账号LMSYS Org (SGLang)@lmsysorg76°NVIDIA推出Qwen3.6-27B-NVFP4模型,采用4位浮点量化,模型大小仅为BF16版本的约1/2.5。该模型在MMLU Pro基准上达到86.3分,与FP8版本性能几乎无损。上下文长度完整保留262K。SGLang已提供Day-0支持,并附带cookbook。AI模型Qwen3.6-27B-NVFP4NVIDIASGLang9 个信源在谈事件专题推荐理由:NVIDIA新出的Qwen3.6-27B模型,4位量化体积小很多但精度没怎么降,SGLang直接就能用,可以去试试。原文稍后读已读值得跟进有用关注 Qwen3.6-27B-NVFP4
03:52官方账号NVIDIA AI@NVIDIAAI78°NVIDIA Research将30B参数的Nemotron-3-Nano-30B-A3B模型拆分为两半,一半维护上下文,一半生成token。该扩散语言模型仅复用预训练权重而非从头训练,在保持98.7%原始质量的同时实现了2.42倍的生成加速。这种方法将传统的自回归逐token生成改为并行写入,显著提升了推理效率。AI模型NemotronNVIDIA扩散语言模型7 个信源在谈事件专题推荐理由:NVIDIA把30B模型劈成两半,并行写token,速度翻倍还保质量,不是新训模型是复用预训练,挺聪明的做法。原文稍后读已读值得跟进有用关注 Nemotron
00:09官方账号LMSYS Org (SGLang)@lmsysorg精选73°LMSYS 发文感谢 NVIDIA 在其最新推理软件经济学报告中提及 SGLang。SGLang 推出针对 Blackwell 架构的 day-0 优化方案,将 DeepSeek V4 的推理性能提升最高 5 倍。该优化通过 CUDA 原生推理路径实现,显著降低了每 token 成本。NVIDIA AI 团队与 SGLang 合作的具体技术细节已在博客中公开。AI模型SGLangNVIDIADeepSeek V48 个信源在谈事件专题推荐理由:SGLang 和 NVIDIA 联手让 DeepSeek V4 在 Blackwell 上跑得快了 5 倍,开源推理引擎的效率又上了一个台阶。原文稍后读已读值得跟进有用关注 SGLang
16:15官方一手marktechpost@Asif RazzaqNVIDIA 发布了 Nemotron-Labs-TwoTower,一个基于冻结的自回归骨干 Nemotron-3-Nano-30B-A3B 的离散扩散语言模型。该模型以开放权重形式提供,采用 NVIDIA Nemotron 开放模型许可证。其核心设计旨在解决自回归模型逐个 token 解码导致的吞吐量瓶颈。通过扩散过程并行生成,有望显著提升文本生成速度。AI模型Nemotron-Labs-TwoTowerNemotron-3-Nano-30B-A3BNVIDIA7 个信源在谈事件专题推荐理由:NVIDIA 把自家 30B 模型改成扩散架构,不再逐个字生成,吞吐量能快很多。开源权重,开发者可以直接拿来用。原文稍后读已读值得跟进有用关注 Nemotron-Labs-TwoTower
15:50AI Will@FinanceYF5根据统计,55位C级高管常驻西雅图,来自Anthropic、OpenAI、NVIDIA、Cisco等公司。还包括Palo Alto Networks、CrowdStrike、Shopify、Stripe。西雅图拥有全美25%的AI工程师和第二大开发者人才池。该数据凸显西雅图作为全球科技巨头工程中心的地位。行业OpenAIAnthropicNVIDIA10 个信源在谈事件专题推荐理由:西雅图不只有AWS和微软,这份统计列出了55位来自Anthropic、OpenAI等公司的C级高管,让你看清AI人才聚集地。原文稍后读已读值得跟进有用关注 OpenAI
14:47IT之家(博客/媒体)精选消息源称英伟达原定 2027 年推出的 Rubin Ultra AI 加速器因制造执行问题放弃 4-Die 方案,改为 2-Die 方案。4-Die 方案需搭配 16 个 HBM4E,面临先进封装接近光罩极限、散热难度飙升以及成本过高挑战。改用 2-Die 后性能缩水一半,可能在与 AMD Instinct MI500 系列竞争中降低竞争力。英伟达转向更易量产的 2-Die 版本。AI产品Rubin UltraNVIDIAHBM4E7 个信源在谈事件专题推荐理由:英伟达下一代AI芯片Rubin Ultra从4颗die砍到2颗,性能减半,因为封装和散热太难搞了。和AMD MI500比可能不占优。原文稍后读已读值得跟进有用关注 Rubin Ultra
13:44IT之家(博客/媒体)81°英伟达在 Blackwell 平台上优化 DeepSeek V4 模型推理,单 Token 成本降至原先的五分之一。Blackwell 平台通过生产运营层、应用加速层、基础设施访问层三层优化,实现分布式服务、专家并行、NVLink 通信等技术。优化后单 GPU token 吞吐量最高提升 20 倍。英伟达将单 Token 成本列为 AI 总拥有成本的核心指标。AI模型NVIDIADeepSeek V4Blackwell6 个信源在谈事件专题推荐理由:英伟达把 DeepSeek V4 的推理成本砍到五分之一,单 GPU 吞吐量暴增 20 倍,选 Blackwell 做推理的可以闭眼冲了。原文稍后读已读值得跟进有用关注 NVIDIA
06:35官方账号NVIDIA AI@NVIDIAAI72°NVIDIA 在 SIGGRAPH 上发表 Generative Pretrained Controllers (GPC),将运动技能编码为离散 token。GPC 使用 transformer 进行下一个 token 预测,类似 GPT 的预训练范式。它在 600+小时运动数据上训练,可实时运行在物理模拟中。同一个预训练控制器通过微调即可适配新任务,生成自然且物理合理的交互动作。AI模型GPCNVIDIASIGGRAPH6 个信源在谈事件专题推荐理由:NVIDIA 把 GPT 的套路用在运动控制上,预训练一个模型就能微调干不同活,物理模拟里跑得又自然又实时。原文稍后读已读值得跟进有用关注 GPC
03:13官方账号Nous Research@NousResearchHermes Agent Accelerated Business Hackathon由NVIDIA AI、Stripe和NousResearch联合举办,提交将于6月30日太平洋时间晚11:59截止。目前仅剩一天时间,鼓励最后时刻提交项目。黑客松聚焦于AI Agent应用开发。行业HermesAgent黑客松10 个信源在谈事件专题推荐理由:还剩一天!想参加NVIDIA和Stripe办的Agent黑客松的话,赶紧提交项目,截止时间是明天晚上。原文稍后读已读值得跟进有用关注 Hermes
02:17官方账号NVIDIA AI@NVIDIAAINemotron Labs发布了一项基于5000名Kaggle竞赛参与者数据的研究。他们分析了参与者的解题行为与推理策略。研究揭示了团队协作和多样化方法对提升AI推理效果的关键作用。这些经验可直接应用于现有模型的优化。论文Nemotron LabsKaggleNVIDIA4 个信源在谈事件专题推荐理由:Nemotron Labs用5000个Kaggle实战案例总结了AI推理的改进方法,比看论文更接地气。原文稍后读已读值得跟进有用关注 Nemotron Labs
01:51官方账号Jim Fan@jimfan精选NVIDIA GEAR lab 联合 UMich、Berkeley、CMU 推出 ASPIRE,这是首个自动化机器人技能发现系统。它不逐个解决任务,而是持续发现并积累可复用技能,作为机器人智能的构建模块。ASPIRE 支持多任务迁移、sim-to-real 迁移以及跨实体迁移。相关论文和项目页面已在 research.nvidia.com 发布。AI模型ASPIRENVIDIA机器人技能发现6 个信源在谈事件专题推荐理由:NVIDIA 和几个顶级高校联手搞了个新系统 ASPIRE,能自动发现并存下可复用的机器人技能,跨任务、跨仿真到现实、跨机器人本体都能迁移,挺有看头。原文稍后读已读值得跟进有用关注 ASPIRE
14:14AI Will@FinanceYF5田渊栋(前Meta FAIR研究员、ELF OpenGo作者、CMU机器人博士)创立Recursive Superintelligence,目标是让AI自主完成研究和自我改进。该公司获得6.5亿美元融资,估值达46.5亿美元,投资方包括GV、NVIDIA和AMD。行业Recursive Superintelligence田渊栋融资6 个信源在谈事件专题推荐理由:田渊栋的新公司让AI自己搞研究,拿了6.5亿美元融资,比很多AI实验室都猛。原文稍后读已读值得跟进有用关注 Recursive Superintelligence
12:27官方账号NVIDIA AI@NVIDIAAINVIDIA 宣布其 Nemotron 模型与 LangChain 集成,覆盖从推理到编排的智能体工作流。开发者可在开放栈上自定义、调优和部署模型。该集成面向生产环境,基于 LangChain 框架实现灵活编排。Nemotron 是 NVIDIA 的前沿智能体性能模型,支持多种部署方式。AI产品NVIDIANemotronLangChain7 个信源在谈事件专题推荐理由:NVIDIA的Nemotron现在接入了LangChain,你可以按需调优和部署智能体,不受厂商锁定,适合做定制化AI代理。原文稍后读已读值得跟进有用关注 NVIDIA
03:09官方一手marktechpost@Asif Razzaq精选NVIDIA 开源了 BioNeMo Agent Toolkit,将 OpenFold3、DiffDock 和 GenMol 等生物分子模型包装为 AI 代理可直接调用的技能。每个技能包含模型用途、输入、输出和失败模式说明。在 NVIDIA 使用 Codex CLI 和 GPT-5.5 fast 的基准测试中,该工具将任务完成率从 57.1% 提升至 100%,并实现 token 效率翻倍。AI产品NVIDIABioNeMo Agent ToolkitOpenFold39 个信源在谈事件专题推荐理由:NVIDIA 开源了这个工具,让 AI 代理能直接调用分子模型做药物发现。用上它任务完成率翻倍还省 Token,做生物计算的同学可以试试。原文稍后读已读值得跟进有用关注 NVIDIA
18:57官方账号vLLM@vllm_project精选NVIDIA 与 vLLM 合作发布 step-by-step 指南,教你用四台 DGX Spark 盒子组建私有集群,自托管 550B 参数的 Nemotron-3-Ultra 模型。指南基于 vLLM 官方容器,可提供兼容 OpenAI 的端点。无需数据中心,适合构建私有 agent 工作流。技巧Nemotron-3-UltraNVIDIADGX Spark10 个信源在谈事件专题推荐理由:想不依赖数据中心自己跑 550B 模型?NVIDIA 出了详细教程,四台 DGX Spark 就能拼出 OpenAI 兼容的端点。原文稍后读已读值得跟进有用关注 Nemotron-3-Ultra
13:50官方账号阿里云 Alibaba Cloud@alibaba_cloud在Flink Forward Asia Shenzhen 2026上,NVIDIA的Chuan Chen介绍了与阿里云的技术合作。双方通过CUDA库加速Apache Flink的多模态数据流处理。这一开源协作实现了端到端高性能多模态流式架构,适用于AI评论、实时图文流和交互式问答。行业NVIDIAAlibaba CloudApache Flink7 个信源在谈事件专题推荐理由:NVIDIA和阿里云用CUDA把Flink的多模态数据处理速度拉满了,想做实时AI评论或图文问答的可以看看这个架构。原文稍后读已读值得跟进有用关注 NVIDIA
09:39IT之家(博客/媒体)精选78°澳大利亚云服务商 Firmus 宣布在印尼峇淡建设一座 360MW 的 AI 工厂,采用 NVIDIA DSX 液冷方案。该工厂由 Firmus 与 DayOne 合作开发,电力容量达 360MW。根据与 NVIDIA 至 2034 年的战略合作,NVIDIA 将在明后两年交付 Grace Blackwell、Vera Rubin、Vera 等多代算力硬件,总计 17 万颗 GPU。Firmus 预计前六年从已承诺承购协议中获得 250~300 亿美元收入。NVIDIA 还是 Firmus 今年四月股权融资的有条件参与方。行业NVIDIAFirmusAI工厂8 个信源在谈事件专题推荐理由:想了解超大规模 AI 数据中心怎么建?Firmus 联手 NVIDIA 在印尼搞了个 360MW 的大项目,17 万颗 GPU,仅硬件收入就有 300 亿美元,值得一读。原文稍后读已读值得跟进有用关注 NVIDIA
22:27官方账号NVIDIA AI@NVIDIAAINVIDIA、Stripe 与 Nous Research 联合举办 The Hermes Agent Accelerated Business Hackathon,要求开发者用 Hermes Agent 构建能赚钱、花钱、运营业务的智能体。比赛使用 NVIDIA NemoClaw 安全运行、Nemotron 3 Ultra 快速推理,以及 Stripe Skills 实现支付和资源采购。奖品包括第一名 $10,000 现金 + DGX Spark + $5,000 Stripe Credits,第二名 $5,000 现金 + DGX Spark + $3,000 Stripe Credits,第三名 $2,500 现金 + DGX Spark + $1,000 Stripe Credits。参赛者需在 6 月 30 日(周二)前提交 1-3 分钟 demo 视频和简短说明至 Discord 及表单。行业NVIDIAStripeNous Research7 个信源在谈事件专题推荐理由:想赢一台 DGX Spark 吗?用 Hermes Agent 造个自动赚钱的 AI 公司,前三名都有现金加硬件,截止 6 月 30 日,快上车。原文稍后读已读值得跟进有用关注 NVIDIA
21:12官方账号LMSYS Org (SGLang)@lmsysorg精选英伟达与智谱AI合作,发布了基于GLM-5.2的NVFP4量化检查点。该模型为744B参数混合专家架构(40B活跃参数),专注于推理和编码任务。NVFP4量化通过NVIDIA Model Optimizer实现,在降低内存占用的同时保持前沿推理性能。模型还支持稀疏注意力和IndexShare索引器,实现高效长上下文处理。目前已在Blackwell/Grace Blackwell上通过SGLang提供首日支持。AI模型GLM-5.2NVFP4NVIDIA5 个信源在谈事件专题推荐理由:英伟达把GLM-5.2压缩成NVFP4,内存省一大截,推理编码在Blackwell上直接跑,SGLang第一时间就能用。原文稍后读已读值得跟进有用关注 GLM-5.2
13:54官方账号vLLM@vllm_project精选NVIDIA发布GLM-5.2的NVFP4检查点,在Blackwell GPU上相比FP8内存占用降低一半。该模型在推理、编码和长上下文基准测试中保持与FP8相同的准确率。用户可通过vLLM直接加载运行:vllm serve nvidia/GLM-5.2-NVFP4。AI模型GLM-5.2NVFP4vLLM4 个信源在谈事件专题推荐理由:想省显存又不想降精度?GLM-5.2的NVFP4版在vLLM上线了,比FP8省一半内存,推理编码长文本都稳。原文稍后读已读值得跟进有用关注 GLM-5.2
11:39官方一手marktechpost@Sana Hassan精选本教程演示如何从Hugging Face流式加载NVIDIA Open-SWE-Traces数据集,无需本地下载即可在Google Colab中高效处理。内容涵盖多轮智能体对话标准化、代码补丁解析、构建包含轨迹长度、工具使用次数、补丁大小、语言分布及解决结果的分析DataFrame。最后基于成功标签、Token限制、语言过滤和补丁可用性筛选出监督微调子集。技巧NVIDIAOpen-SWE-TracesHugging Face5 个信源在谈事件专题推荐理由:想自己动手做代码智能体微调数据?这教程手把手教你解析NVIDIA开源的Open-SWE-Traces,连Token预算和工具使用指标都算好了。原文稍后读已读值得跟进有用关注 NVIDIA