主要来源arXiv: DeepSeek
查看原文事件专题 · 官方一手
网格搜索前先思考:LLM服务的Floor-First分诊方法
Floor-First提出一种基于残差驱动的LLM服务优化工作流,将每个解码步骤建模为五维资源向量(HBM字节、FLOPs、网络字节、网络消息、KV容量),通过求和与取最大值得到乐观下限与悲观下限区间,无需剖析器即可评估重叠质量。以DeepSeek-V3.2风格671B MoE/MLA模型在16块NVIDIA H20 GPU上验证:TP16解码在~74 FLOP/byte下受KV容量限制,仅支持约70并发8K请求;EP16+DP-attention布局将容量墙提升至~644,但单流延迟比TP慢2.4倍。该方法通过资源墙排序而非点基准比较部署方案,且支持新注意力模块的组合式接入。
当前结论
别盲目跑网格搜索了。这篇论文提出Floor-First方法,用资源向量估算性能下限,在DeepSeek-V3.2上验证了不同注意力布局的容量墙差异,帮你理性选部署方案。
5 个信源58° AI 热度最后更新 2026/7/7 06:11:54
证据链
相关来源 1NVIDIA AI
查看原文相关来源 2elvis
查看原文相关来源 3@koltregaskes
查看原文相关来源 4LangChain
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。