16:16Geek@geekbbAlec Fong 在单台 GB300 DGX Station 上部署 DeepSeek V4 Flash,测得聚合峰值吞吐 1875 tok/s,单流 300 tok/s,128k 上下文下首 token 延迟 5 秒。推文感叹能在家部署该模型的人相当于 80 年代万元户,令人羡慕。AI模型DeepSeek V4 FlashDGX Station推理性能8 个信源在谈事件专题推荐理由:有人晒了 DeepSeek V4 Flash 在 DGX Station 上的实测数据,单机每秒能跑 1875 个 token,128k 上下文首字只要 5 秒,你可以拿这个数去衡量本地部署值不值。原文稍后读已读值得跟进有用关注 DeepSeek V4 Flash
01:38andrew chen@andrewchen精选MiaAI实验室用Hermes agent根据一条X帖子,在一夜之间自动完成了DeepSeek v4 Flash GA (0731)在2块NVIDIA DGX Sparks上的部署。部署使用官方FP8权重,单流推理速度达82 tok/s,峰值约95 tok/s,三会话并发时达到135 tok/s。该方案已发布在GitHub上,并感谢了0xSero提交的PR,后续还会改进部署配方。AI模型DeepSeek v4 FlashHermesNVIDIA DGX Sparks10 个信源在谈事件专题推荐理由:Hermes agent看了条帖子就自动部署好DeepSeek v4 Flash,双DGX Sparks跑出82 tok/s,省人力还快。原文稍后读已读值得跟进有用关注 DeepSeek v4 Flash
11:56官方账号arXiv cs.LG@Mauricio Fadel Argerich, Jonathan Fürst, Marta Patiño-MartínezWattGPU提出了两个预测模型,分别用于平均GPU功耗和令牌间延迟(ITL),仅利用公开的LLM元数据和GPU规格,无需硬件访问或预配置。在42个开源LLM(0.1B-27B参数)和8个GPU的数据集上,通过留一GPU和留一LLM交叉验证,功耗模型在离线场景下中位数绝对百分比误差≤3.4%,服务器场景下≤13.5%;延迟模型在服务器模式下≤8.5%,且GPU排名相关性Kendall τ≥0.76。与基于功耗的热设计功率(TDP)和基于延迟的roofline基线相比,WattGPU在未见过LLM-GPU组合上误差降低约4倍,在完全未见过GPU上降低约2倍。AI模型WattGPULLMGPU推荐理由:想省电又怕买错GPU?WattGPU用公开数据就能预测新GPU和新LLM的功耗和速度,不用自己跑实验,误差才几个点。原文稍后读已读值得跟进有用关注 WattGPU
12:38Dylan Patel (SemiAnalysis)@dylan522p该分析报告对 DeepSeek 推理系统在多种硬件平台上的性能进行了详细评估,包括 NVIDIA GB200 NVL72、Blackwell、AMD MI355X 以及华为的芯片。报告还提供了过去 44 天内每日性能随时间变化的追踪数据。这些数据对于理解不同硬件在 AI 推理任务中的实际表现和稳定性具有重要参考价值,尤其适合关注硬件选型和性能优化的 AI 工程师。行业DeepSeek推理性能GB200 NVL7210 个信源在谈事件专题推荐理由:这份 44 天的性能追踪数据对做 AI 推理部署的团队很有价值,能直观对比 NVIDIA、AMD 和华为硬件的实际表现,建议点开看具体趋势。原文稍后读已读值得跟进有用关注 DeepSeek
01:46Fireworks AI@FireworksAI_HQ在 MSBuild 大会第二天,Fireworks AI 的 @chahvivi 将主持一场现场演示,主题是如何超越通用基础模型,聚焦定制化、推理性能以及生产级 AI 的规模化部署。活动包含真实案例研究,旨在帮助开发者理解如何将 AI 从实验阶段推向实际应用。该演示在 build.microsoft.com 上可观看,适合关注 AI 工程化和部署的团队。行业MSBuildFireworks AI定制化推荐理由:Fireworks AI 的演示直击 AI 落地的核心痛点——定制化和推理性能,做 AI 工程化的团队值得一看,能学到如何把模型从实验推到生产级规模。原文稍后读已读值得跟进有用关注 MSBuild