23:58shao__meng@shao__meng社交媒体爆料称,Moonshot 已在筹备 Kimi K4,内部已出现相关引用。传闻 K4 参数量可能达到 5-6T,但尚未证实。Moonshot 正在寻求更多 NVIDIA Blackwell 算力,新 MoonEP 基础设施似乎为扩大 MoE 系统设计。爆料者预测 K4 有 75% 概率比 K3 大很多。当前 K3 价格已让普通用户觉得昂贵,未来模型可能分化为超贵超大和日常廉价两档。AI模型Kimi K4MoonshotK310 个信源在谈事件专题推荐理由:看热闹的来了,K3 刚出就有人爆 K4 料,参数量可能冲到 5-6T,还牵扯到 Blackwell 算力抢购,想了解下一代卷王的可以看看。原文稍后读已读值得跟进有用关注 Kimi K4
00:12小互@imxiaohuNVIDIA在GTC 2024上发布Blackwell架构GPU B200,集成2080亿晶体管。相比H100,大模型训练性能提升约4倍。首批客户包括OpenAI和微软。该芯片预计2024年晚些时候出货。AI模型NVIDIABlackwellB20010 个信源在谈事件专题推荐理由:WSJ详细介绍了Blackwell B200的架构和性能,想了解最新AI芯片的来看看。原文稍后读已读值得跟进有用关注 NVIDIA
14:24IT之家(博客/媒体)82°英伟达宣布其 Blackwell GB300 在 256 块 GPU 上预训练 DeepSeek-v3 671B 模型,每 GPU 算力达到 1648 TFLOPs,刷新 MoE 预训练世界纪录。相比 2025 年 11 月的 1088 TFLOPs,性能优化提升 50%。与上一代 GB200 的 606 TFLOPs 相比,GB300 实现了约 3 倍性能跃升。英伟达通过模拟超过 25 万种配置,发现 38 项优化方案,累计进行 140 万小时 GPU 优化测试。AI模型DeepSeek-v3英伟达Blackwell推荐理由:英伟达用 Blackwell GB300 跑 DeepSeek-v3,每 GPU 1648 TFLOPs,比上一代快 3 倍,技术优化真猛。原文稍后读已读值得跟进有用关注 DeepSeek-v3
14:07IT之家(博客/媒体)76°英伟达7月22日发布Rubin GPU架构细节,该GPU基于台积电3nm工艺,集成3360亿个晶体管。智能体AI工作负载的单位能耗吞吐量是Blackwell的10倍,提升源自增强型Tensor Core、HBM4内存和第三代Transformer引擎。Rubin搭载8个HBM4堆栈,总容量288GB,峰值带宽22TB/s,较Blackwell的8TB/s提升1.8倍。架构由两块Die通过NV-HBI连接,包含224个SM和896个Tensor Cores,NVLink 6提供3600GB/s互联带宽。AI模型RubinBlackwell英伟达推荐理由:英伟达新Rubin GPU细节揭秘,晶体管比Blackwell多62%,智能体AI性能翻10倍,搞AI芯片的必看。原文稍后读已读值得跟进有用关注 Rubin
20:51@koltregaskes@koltregaskes74°Emad Mostaque声称美国供应商能以中国十分之一价格运行Kimi K3,但分析显示实际约2-5倍便宜。美国电力成本更高(9美分/千瓦时 vs 中国工业6美分/千瓦时),电力占推理成本约25%。Blackwell系统每瓦可用算力是华为Ascend集群两倍,Nvidia成熟工具链在开放权重后数周内可降低2-5倍成本。中国在数据中心建设和劳动力成本有优势,但硅效率主导前沿推理。行业Kimi K3NvidiaBlackwell10 个信源在谈事件专题推荐理由:别信10倍差价,实际2-5倍。美国硬件强但电费贵,看Blackwell vs 华为Ascend谁更划算。原文稍后读已读值得跟进有用关注 Kimi K3
23:30IT之家(博客/媒体)73°英伟达发布了专为 RTX Spark PC 定制的 Windows 11 Arm64 驱动程序,版本号为 616.00。驱动文件确认了两款 RTX Spark N1X GPU 配置,分别搭载 6144 和 5120 个 Blackwell RTX 核心。该平台采用 Arm CPU 结合 Blackwell GPU,最高提供 20 个 CPU 核心和 128GB 统一内存。微软已为 RTX Spark 优化 Windows 11 调度器,并计划通过 MPTF 框架管理功耗。首批产品预计 2026 年秋季上市,包括微软、华硕、戴尔等品牌的笔记本和迷你主机。AI模型RTX SparkN1XBlackwell推荐理由:英伟达的 RTX Spark 驱动曝光了 6144 核心猛兽,Arm Windows PC 要变天了,微软还专门改了调度器,等等党的新目标来了。原文稍后读已读值得跟进有用关注 RTX Spark
09:43Fireworks AI@FireworksAI_HQ精选74°MiniMax AI发布M3内核,针对长上下文稀疏注意力中数据依赖块选择导致的内存访问瓶颈。M3采用KV-stationary设计,每个块仅读取一次。在B200 GPU上达到约980 TFLOP/s的算力。该方案有效提升长上下文推理效率。AI模型MiniMaxM3Blackwell推荐理由:MiniMax搞了个M3内核,KV-stationary让稀疏注意力在B200上跑到980 TFLOP/s,每个块只读一次,长上下文推理加速神器。原文稍后读已读值得跟进有用关注 MiniMax
00:09官方账号LMSYS Org (SGLang)@lmsysorg精选73°LMSYS 发文感谢 NVIDIA 在其最新推理软件经济学报告中提及 SGLang。SGLang 推出针对 Blackwell 架构的 day-0 优化方案,将 DeepSeek V4 的推理性能提升最高 5 倍。该优化通过 CUDA 原生推理路径实现,显著降低了每 token 成本。NVIDIA AI 团队与 SGLang 合作的具体技术细节已在博客中公开。AI模型SGLangNVIDIADeepSeek V48 个信源在谈事件专题推荐理由:SGLang 和 NVIDIA 联手让 DeepSeek V4 在 Blackwell 上跑得快了 5 倍,开源推理引擎的效率又上了一个台阶。原文稍后读已读值得跟进有用关注 SGLang
13:44IT之家(博客/媒体)81°英伟达在 Blackwell 平台上优化 DeepSeek V4 模型推理,单 Token 成本降至原先的五分之一。Blackwell 平台通过生产运营层、应用加速层、基础设施访问层三层优化,实现分布式服务、专家并行、NVLink 通信等技术。优化后单 GPU token 吞吐量最高提升 20 倍。英伟达将单 Token 成本列为 AI 总拥有成本的核心指标。AI模型NVIDIADeepSeek V4Blackwell6 个信源在谈事件专题推荐理由:英伟达把 DeepSeek V4 的推理成本砍到五分之一,单 GPU 吞吐量暴增 20 倍,选 Blackwell 做推理的可以闭眼冲了。原文稍后读已读值得跟进有用关注 NVIDIA
03:18官方账号NVIDIA AI@NVIDIAAI精选NVIDIA发布DFlash,一种开源轻量级块扩散模型,专为投机解码设计。在NVIDIA Blackwell硬件上,DFlash可实现高达15倍的推理吞吐量提升,同时保持相同的用户交互响应速度。与传统逐token解码不同,DFlash一次生成整个token块,由主模型并行验证。该方案即插即用,已集成到SGLang、TensorRT-LLM和vLLM等框架中。AI模型DFlashNVIDIABlackwell8 个信源在谈事件专题推荐理由:NVIDIA开源了DFlash,用块扩散投机解码让Blackwell推理提速15倍,还支持SGLang和vLLM,随手就能用。原文稍后读已读值得跟进有用关注 DFlash
07:25IT之家(博客/媒体)83°英伟达在MLPerf Training 6.0七项基准测试中全部夺魁,Blackwell平台成为唯一全覆盖的提交系统。全新GB300 NVL72相比GB200 NVL72同等规模带来1.6倍训练速度提升。CoreWeave使用基于Spectrum-X以太网的GB300 NVL72系统,在8192块GPU规模下将DeepSeek-V3 671B训练耗时缩短至2.02分钟。本次测试首次引入DeepSeek-V3 671B和GPT-OSS-20B两个MoE工作负载,刷新了大规模训练效率纪录。AI模型NVIDIABlackwellDeepSeek-V39 个信源在谈事件专题推荐理由:英伟达Blackwell平台在MLPerf上把DeepSeek-V3 671B训练时间压到2分钟,比上代快60%,性能真狠。原文稍后读已读值得跟进有用关注 NVIDIA
10:37IT之家(博客/媒体)71°Tensordyne 发布 Napier 推理系统,宣称能效是 NVIDIA Blackwell 系统的 17 倍,吞吐量达 13 倍。Napier 采用对数数学设计简化乘法运算,由台积电 3nm 制程生产。TDN72 集成 72 颗芯片,机柜级系统可支持 1000 Token/s/user 的 LLM 推理。AI产品TensordyneNapierBlackwell4 个信源在谈事件专题推荐理由:Tensordyne 搞了个叫 Napier 的推理芯片,用对数数学省掉了乘法,据说比 NVIDIA Blackwell 快 13 倍,能耗还低 17 倍。初创敢叫板老黄,看看值不值。原文稍后读已读值得跟进有用关注 Tensordyne
09:48官方账号Together AI@togethercompute精选Together AI 发布了基于 Blackwell 的推理引擎,在 AgentPerf 基准测试中,其 TPS 比次快的开源引擎高出 31%。该引擎通过为 Blackwell 的 Tensor Core 指令定制内核实现性能提升。Cursor 已将其实时编程助手部署在该推理栈上。Together AI 在推文中详细介绍了构建过程。AI模型Together AIBlackwell推理引擎4 个信源在谈事件专题推荐理由:Blackwell 上推理快了 31%原文稍后读已读值得跟进有用关注 Together AI
12:38Dylan Patel (SemiAnalysis)@dylan522p该分析报告对 DeepSeek 推理系统在多种硬件平台上的性能进行了详细评估,包括 NVIDIA GB200 NVL72、Blackwell、AMD MI355X 以及华为的芯片。报告还提供了过去 44 天内每日性能随时间变化的追踪数据。这些数据对于理解不同硬件在 AI 推理任务中的实际表现和稳定性具有重要参考价值,尤其适合关注硬件选型和性能优化的 AI 工程师。行业DeepSeek推理性能GB200 NVL7210 个信源在谈事件专题推荐理由:这份 44 天的性能追踪数据对做 AI 推理部署的团队很有价值,能直观对比 NVIDIA、AMD 和华为硬件的实际表现,建议点开看具体趋势。原文稍后读已读值得跟进有用关注 DeepSeek
12:20官方账号Tri Dao (FlashAttention)@tri_dao精选WentaoGuo7 提出了一种对混合专家模型(MoE)反向传播的数学重写方法,显著降低了激活内存占用,并大幅提升了训练速度,尤其适用于细粒度MoE。该方法还利用了NVIDIA Blackwell架构的新特性(如2CTA MMA和CLC)来构建超快MoE内核。这一进展对于训练大规模MoE模型的团队具有重要意义,能有效缓解内存瓶颈并加速迭代。AI模型MoE反向传播内存优化10 个信源在谈事件专题推荐理由:做MoE模型训练和推理的开发者,这个数学重写能直接降低你的显存压力并加速训练,尤其适合细粒度MoE场景,建议试试Blackwell新特性带来的性能提升。原文稍后读已读值得跟进有用关注 MoE
12:19官方账号Tri Dao (FlashAttention)@tri_dao精选一位开发者宣布,快速 muon 优化器即将支持消费级显卡。所有代码均以 matmul + epilogue 形式编写,因此一旦为 Blackwell 消费级显卡实现了主循环,所有高级对称矩阵乘法即可自动获得光速性能。这意味着普通用户也能在自家显卡上高效运行该优化器,无需依赖专业硬件。AI模型muon优化器消费级显卡Blackwell推荐理由:这个优化器让消费级显卡也能跑出专业级训练性能,做模型微调或自训练的开发者可以直接关注,省下买高端硬件的钱。原文稍后读已读值得跟进有用关注 muon优化器
08:05官方账号NVIDIA AI@NVIDIAAI精选72°NVIDIA 在 Blackwell 平台上使用 NVFP4 精度训练了 Llama 3 8B 和 405B 模型。实验结果显示,相比 FP8 精度,NVFP4 实现了 1.31 到 1.73 倍的训练速度提升,且未出现任何精度损失。这一突破意味着大模型训练可以在更短的时间内完成,同时保持模型质量。对于需要大规模训练 AI 模型的团队来说,这能显著降低计算成本和等待时间。AI模型NVIDIABlackwellNVFP44 个信源在谈事件专题推荐理由:训练速度提升 1.3-1.7 倍且零精度损失,做大规模模型训练的团队可以直接在 Blackwell 上尝试 NVFP4,省时省成本。原文稍后读已读值得跟进有用关注 NVIDIA
11:20IT之家(博客/媒体)精选英伟达在 2026 台北电脑展上展示了 RTX Spark 平台,其 CPU 部分采用 10 个 Cortex-X925 和 10 个 Cortex-A725 核心,借鉴了联发科天玑 9400 和 8500 的设计。该平台基于台积电 3nm 工艺,GPU 为 Blackwell RTX 架构,拥有 6144 个 CUDA 核心,FP4 AI 性能达 1 PFLOP。支持最高 128GB LPDDR5X 统一内存,CPU-GPU 间 NVLink-C2C 带宽约 600GB/s。软件生态覆盖 CUDA、TensorRT、DLSS 等。这一设计旨在与英特尔、AMD、高通竞争 PC 芯片市场,标志着英伟达在 ARM PC 领域的重大布局。AI产品英伟达RTX SparkARM PC推荐理由:英伟达联手联发科打造 ARM PC 芯片,20 核设计直指英特尔和 AMD 的桌面市场,做高性能计算或 AI 开发的 PC 玩家值得关注这一新生态的潜力。原文稍后读已读值得跟进有用关注 英伟达