SGLang是一个开源的大模型推理框架,专为高效部署和运行大规模语言模型而设计。由阿里巴巴通义团队开发,SGLang已成为开源AI社区中备受关注的模型部署工具,支持多种大模型的快速部署和推理优化。
SGLang 近期进展
RTX 5090显卡上SGLang实现了单卡206 tok/s的推理速度,这一数据在Qwen3.8-27B模型开源后迅速得到验证,展示了SGLang在硬件加速方面的卓越性能。Qwen3.8-27B开源,SGLang Day-0支持单卡RTX 5090跑206 tok/s社区开发者已推出"从零手搓SGLang"的开源课程,降低了开发者使用门槛,表明SGLang的开发生态正在快速形成。从零手搓 SGLang 的开源课程
SGLang已实现对Qwen3.8-Flash-Next模型的快速部署,展现了其对最新大模型的兼容能力和持续更新的技术路线。Qwen3.8-Flash-Next 与 SGLang 部署