#Blackwell
Perplexity宣布用上NVLink Blackwells,每天5000万查询的AI搜索服务性能提升,还能扩展到Vera Rubins。
英伟达用 Blackwell GB300 跑 DeepSeek-v3,每 GPU 1648 TFLOPs,比上一代快 3 倍,技术优化真猛。
英伟达新Rubin GPU细节揭秘,晶体管比Blackwell多62%,智能体AI性能翻10倍,搞AI芯片的必看。
英伟达的 RTX Spark 驱动曝光了 6144 核心猛兽,Arm Windows PC 要变天了,微软还专门改了调度器,等等党的新目标来了。
MiniMax搞了个M3内核,KV-stationary让稀疏注意力在B200上跑到980 TFLOP/s,每个块只读一次,长上下文推理加速神器。
SGLang 和 NVIDIA 联手让 DeepSeek V4 在 Blackwell 上跑得快了 5 倍,开源推理引擎的效率又上了一个台阶。
英伟达把 DeepSeek V4 的推理成本砍到五分之一,单 GPU 吞吐量暴增 20 倍,选 Blackwell 做推理的可以闭眼冲了。
英伟达Blackwell平台在MLPerf上把DeepSeek-V3 671B训练时间压到2分钟,比上代快60%,性能真狠。
Tensordyne 搞了个叫 Napier 的推理芯片,用对数数学省掉了乘法,据说比 NVIDIA Blackwell 快 13 倍,能耗还低 17 倍。初创敢叫板老黄,看看值不值。
这份 44 天的性能追踪数据对做 AI 推理部署的团队很有价值,能直观对比 NVIDIA、AMD 和华为硬件的实际表现,建议点开看具体趋势。
做MoE模型训练和推理的开发者,这个数学重写能直接降低你的显存压力并加速训练,尤其适合细粒度MoE场景,建议试试Blackwell新特性带来的性能提升。
训练速度提升 1.3-1.7 倍且零精度损失,做大规模模型训练的团队可以直接在 Blackwell 上尝试 NVFP4,省时省成本。
英伟达联手联发科打造 ARM PC 芯片,20 核设计直指英特尔和 AMD 的桌面市场,做高性能计算或 AI 开发的 PC 玩家值得关注这一新生态的潜力。