#SGLang
SGLang、Qwen和NVIDIA联手推出NVFP4 KV Cache,4-bit精度下1.78倍容量提升,长上下文推理提速近80%。
Qwen-Image 2.1 一张 4090 就能跑,18.7 秒出图还带透明底输出,SGLang 当天就给出了部署命令。
Datawhale 和 RadixArk 联合发起的开源课程,教你从零手搓 mini-sglang,最后能对照真实 SGLang 源码提 PR,适合想深入了解 LLM 推理引擎的人。
Qwen3.8-27B开源了,SGLang当天就能跑,单张5090能到206 tok/s,小模型之王回来了,试试吧。
SGLang团队搞的FlashBoot,把大模型权重加载从20秒压到0.4秒,跨节点复制只要10毫秒。跑DeepSeek-V4系列,NVL72上实测数据,做弹性部署的值得看。
想跑 Muse Glimmer?SGLang 直接支持,单张 5090 约 230 tok/s,还兼容 Apple Silicon。
Poolside的Laguna S 2.1是个118B参数的稀疏MoE模型,只激活8B参数,SWE-bench多语言拿下78.5%,还能跑在单个DGX Spark上,适合长时编程任务。
SGLang让GLM5.2在B300上单用户跑500 tok/s,交互延迟几乎不随上下文增长,对多轮Agent任务很实用。
Netpreme的X-Mem内存插进SGLang的HiCache,多轮对话缓存带宽不再是瓶颈,TTFT降6.7倍,吞吐量涨30%,实测SWE-bench效果显著。
想低成本跑DeepSeek?有第三方用SGLang和AMD MI300把API成本压到官方的五分之一,技术方案公开,值得参考。
SGLang加入DSpark后,高并发场景下吞吐能提升20%,在DeepSeek-V4上实测383.7 tok/s,推理优化党可以试试。
腾讯混元新模型Hy3,21B激活参数就能比肩更大模型,幻觉率从12.5%降到5.4%,多轮对话能力大增,现在就能在SGLang上跑。
poolside新出的Laguna XS 2.1,33B MoE专为编程智能体设计,SWE-bench 70.9%还支持Mac本地跑,值得编程党试试
SGLang 和 NVIDIA 联手让 DeepSeek V4 在 Blackwell 上跑得快了 5 倍,开源推理引擎的效率又上了一个台阶。
SGLang 新功能无限 OCR 能一口气处理几十页文档,显存占用不变,比传统注意力省资源,适合长文档批量 OCR 场景。
SGLang给DeepSeek模型加了两个新负载均衡器,跑DeepSeek V3/R1速度能快最多7%,而且不改精度,想加速推理的可以试试。
Krea 2 开源了双版本,RAW 用来训练 LoRA,Turbo 跑推理,直接用 SGLang 就能跑,比闭源模型更灵活。
poolside刚发的225B MoE模型Laguna M.1,专为智能体编码设计,SGLang直接跑起来了,在SWE-bench上很强。
Zai_org 的 GLM-5.2 来了,1M 长上下文拿下了 81.0 的 Terminal-Bench 分数,比上一代高出一截,而且推理效率也优化了,值得上手试试。
LMSYS 和 Modal 联手推出了 DFlash,让 Qwen 3.5 的推理速度比原生 MTP 快 1.5 倍,比基线快 4.3 倍,代码已开源,玩起来!
SGLang 第一时间支持 MiniMax-M3,做多模态推理和长上下文应用的团队可以直接上手体验 428B 模型的稀疏注意力加速,编码和智能体任务表现值得一试。