DeepSeek V4-Flash 单 GPU 吞吐量对比引争议:72 TPS 仅为其三分之一
有人实测推理只有 72 TPS,对比 DeepSeek V4-Flash 在 DSpark 报告里的单 GPU 成绩直接少了三分之二,评论里讨论了 TileLang 内核和 npugraph_ex 还能优化多少。
有人实测推理只有 72 TPS,对比 DeepSeek V4-Flash 在 DSpark 报告里的单 GPU 成绩直接少了三分之二,评论里讨论了 TileLang 内核和 npugraph_ex 还能优化多少。
Artificial Analysis开源了本地AI模型测试工具AA-AgentPerf-Local,能帮你评估笔记本和工作站上智能体AI的运行速度,支持多种硬件和模型。
DeepSeek 的工程师们优化了他们的 V4-Flash 模型,让它跑在 AMD 的 GPU 上更快了,解码速度提升明显。
有人晒了 DeepSeek V4 Flash 在 DGX Station 上的实测数据,单机每秒能跑 1875 个 token,128k 上下文首字只要 5 秒,你可以拿这个数去衡量本地部署值不值。
Hermes agent看了条帖子就自动部署好DeepSeek v4 Flash,双DGX Sparks跑出82 tok/s,省人力还快。
这份 44 天的性能追踪数据对做 AI 推理部署的团队很有价值,能直观对比 NVIDIA、AMD 和华为硬件的实际表现,建议点开看具体趋势。
Fireworks AI 的演示直击 AI 落地的核心痛点——定制化和推理性能,做 AI 工程化的团队值得一看,能学到如何把模型从实验推到生产级规模。