sglang·general

SGLang

别名
首次出现
2026-05-22
最近出现
2026-07-24
累计提及
98
§ 01综述

SGLang 是一个高效的大语言模型推理引擎,专为加速模型部署和推理而设计,近期在性能优化和生态扩展上取得多项突破。

SGLang 近期进展

  • DeepSeek-V4 Flash RL 在 AMD MI355X 上完成端到端训练:LMSYS Org 于 2025年6月宣布,基于SGLang的DeepSeek-V4 Flash RL训练在AMD MI355X上完整跑通,验证了其跨平台兼容性。原文
  • 第三方用SGLang+AMD MI300将DeepSeek API成本降至五分之一:2025年6月,有开发者利用SGLang和AMD MI300集群,将DeepSeek API的推理成本降低80%,引发业界对低成本替代方案的关注。原文
  • Agent辅助SGLang开发:吞吐提升71.4%,TTFT降63%:2025年6月,LMSYS Org 发布Agent辅助优化成果,通过智能调度使SGLang吞吐量提升71.4%,首次令牌时间(TTFT)降低63%。原文
  • SGLang集成DSpark:置信度驱动变长验证提升推测解码吞吐:2025年6月,DSpark技术被集成到SGLang,利用置信度动态调整验证长度,使推测解码的吞吐显著提升。原文
  • 当前焦点与观察点

    当前焦点集中在SGLang的跨硬件适配和成本优化。AMD平台上的突破性成果(如MI300和MI355X)表明SGLang正从NVIDIA专属走向更开放的生态。同时,腾讯混元Hy3 MoE模型(295B参数、21B激活、256K上下文)发布时也提及SGLang支持,进一步巩固其在大模型推理中的地位。此外,摩尔线程完成美团LongCat-2.0极速适配,显示国产硬件生态的接入。争议点在于,SGLang的高效优化是否会导致对特定硬件的依赖,以及社区贡献的可持续性。总体来看,SGLang正成为大模型推理基础设施的关键组件,性能与成本的双重突破将推动更多实际应用落地。

    § 02相关报道10 条在档
    1. 01
      Windowed-MTP:消除百万token上下文中的全上下文草稿KV负担
      arXiv cs.LG
    2. 02
      Poolside发布Laguna S 2.1:118B参数、1M上下文,支持SGLang
      LMSYS Org (SGLang)
    3. 03
      thinkymachines开源Inkling:975B总参/41B激活MoE,1M上下文多模态
      LMSYS Org (SGLang)
    4. 04
      SGLang在8xB300上以500 TPS服务GLM5.2 NVFP4 Agentic工作负载
      LMSYS Org (SGLang)
    5. 05
      DeepSeek-V4 Flash RL 在 AMD MI355X 上完成端到端训练
      LMSYS Org (SGLang)
    6. 06
      MOSS-Transcribe-Diarize-0.9B 开源,端到端多说话人ASR模型
      LMSYS Org (SGLang)
    7. 07
      Netpreme X-Mem加速SGLang HiCache缓存
      LMSYS Org (SGLang)
    8. 08
      第三方用SGLang+AMD MI300将DeepSeek API成本降至五分之一
      AI Will
    9. 09
      xAI SGLang负责人讲解10万GPU部署Grok
      AI Will
    10. 10
      腾讯混元发布Hy3 MoE模型,295B参数领先GLM-5.1
      Hunyuan
    § 03邻近话题

    本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

    /topic/SGLang