事件专题 ·官方一手

SPLASH:大模型服务中切换注意力并行布局

SPLASH系统可在请求运行时切换注意力并行布局,支持张量并行、数据并行、上下文并行和新型解耦所有权并行(DOP)。在B200 GPU上服务GLM-5.3时,SPLASH比固定布局部署提升1.3-1.73倍端到端吞吐量。DOP比数据并行注意力提供27-60%更多KV容量,且不复制数据。该系统在DeepSeek-V3.2(H200)和GLM-5.3-Flash(DCU)上也展现出相同布局优势。

当前结论

SPLASH让大模型服务能动态切换并行策略,在GLM和DeepSeek模型上显著提升吞吐,解决固定布局的局限性。

7 个信源67° AI 热度最后更新 2026/9/29 14:02:29

证据链

7 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。