10:24官方一手arXiv: DeepSeek@Lie Li, Wen Li, Junxiao Shen, Gusheng Hu精选MAPLE是一个即插即用的MoE专家分配框架,可在不修改权重不重训练的前提下,按层重新分配路由专家预算。其核心是封闭式灵敏度引导分配,并用灵敏度约束的遗传搜索进一步优化。在DeepSeek-MoE-16B上,MAPLE仅用75%专家即在ARC-E上从65.09提升至71.40,ARC-C从48.49提升至51.50,BoolQ从80.03提升至82.38。通过SGLang部署,单GPU端到端延迟降低32.2%,吞吐量提升47.4%。AI模型MAPLEDeepSeek-MoE-16BSGLang推荐理由:MAPLE这个插件能让MoE大模型少开专家还更准,DeepSeek-MoE-16B用75%专家就能超原版,还快32%,不用改权重就能用。原文稍后读已读值得跟进有用关注 MAPLE
00:26官方账号阿里通义 Qwen@Alibaba_Qwen76°阿里开源Qwen3.8-27B,SGLang团队当天完成适配。在单张RTX 5090上,借助NVFP4和DSpark优化,解码速度达到206.1 tok/s。在DGX Spark上解码速度为38.28 tok/s。该模型在智能体规划和长时任务上表现突出。AI模型Qwen3.8-27BSGLangRTX 50904 个信源在谈事件专题推荐理由:Qwen3.8-27B开源了,SGLang当天就能跑,单张5090能到206 tok/s,小模型之王回来了,试试吧。原文稍后读已读值得跟进有用关注 Qwen3.8-27B
10:43官方一手arXiv: DeepSeek@Issac Zhu, Hscos Zhang, Keith Jiang, Jack Li, Hugh Yin, Jason Zhao精选FlashBoot是SGLang上的权重加载子系统,针对MoE模型弹性部署中的延迟问题。它通过FabricArena连续内存布局和FlashLoad零拷贝批量传输,将单节点权重加载从20.1秒降至0.4秒,加速50倍。FlashClone利用远程映射替代NCCL初始化,将跨节点复制时间从10-110秒降至约10毫秒。在NVL72上测试DeepSeek-V4-Pro和DeepSeek-V4-Flash,并发机架级加载从87秒降至0.32秒,加速超270倍。论文FlashBootSGLangDeepSeek-V48 个信源在谈事件专题推荐理由:SGLang团队搞的FlashBoot,把大模型权重加载从20秒压到0.4秒,跨节点复制只要10毫秒。跑DeepSeek-V4系列,NVL72上实测数据,做弹性部署的值得看。原文稍后读已读值得跟进有用关注 FlashBoot
21:44官方账号NVIDIA AI@NVIDIAAI精选SGLang 宣布为 Meta 的 Muse Glimmer 模型提供首发日支持。在单块 RTX 5090 上启用 NVFP4 与 DFlash 后,推理速度约 230 tok/s。该模型也可在 RTX PRO 6000、DGX Spark 上直接运行,并通过 MLX 兼容 Apple Silicon。官方表示这有助于在本地构建智能体应用。AI产品SGLangMuse GlimmerMeta推荐理由:想跑 Muse Glimmer?SGLang 直接支持,单张 5090 约 230 tok/s,还兼容 Apple Silicon。原文稍后读已读值得跟进有用关注 SGLang
22:37官方账号LMSYS Org (SGLang)@lmsysorg81°Poolside发布Laguna S 2.1模型,总参数量118B,采用稀疏MoE架构,每token仅激活8B参数。模型支持1M上下文窗口,提供思考与非思考两种模式。在Terminal-Bench 2.1上获得70.2%准确率,在SWE-bench Multilingual上达78.5%。官方NVFP4量化版本可运行于单个NVIDIA DGX Spark。模型已在SGLang框架上提供Day-0支持。AI模型Laguna S 2.1PoolsideSGLang10 个信源在谈事件专题推荐理由:Poolside的Laguna S 2.1是个118B参数的稀疏MoE模型,只激活8B参数,SWE-bench多语言拿下78.5%,还能跑在单个DGX Spark上,适合长时编程任务。原文稍后读已读值得跟进有用关注 Laguna S 2.1
21:16官方账号LMSYS Org (SGLang)@lmsysorg73°SGLang通过优化在8块B300 GPU上实现bs=1时每用户500+ tok/s的吞吐量,单用户交互性相比基线提升18%至34%,高并发峰值吞吐提升6%至11%。新推出的TopK-V2内核在80K输入长度下加速2.33倍,在1M长度下加速10.17倍,使交互性在1M token范围内基本持平。GLM-5.2模型采用IndexShare架构于DSA层和更强的MTP头,结合SGLang的服务优化共同达成这一性能。AI模型GLM-5.2SGLangB300推荐理由:SGLang让GLM5.2在B300上单用户跑500 tok/s,交互延迟几乎不随上下文增长,对多轮Agent任务很实用。原文稍后读已读值得跟进有用关注 GLM-5.2
22:17官方账号LMSYS Org (SGLang)@lmsysorg精选71°MosiAI 团队开源 MOSS-Transcribe-Diarize-0.9B,仅 0.9B 参数,基于 Whisper-Medium 编码器和 Qwen3-0.6B 风格解码器。模型支持 128K 上下文,可一次性处理约 90 分钟长音频。输出直接包含时间戳和说话人标签,无需分块或单独说话人分离。还支持热词提升,用于人名、领域术语和代码切换场景。SGLang 已提供 Day-0 支持,可立即运行。AI模型MOSS-Transcribe-Diarize-0.9BMosiAISGLang1 个信源在谈事件专题推荐理由:MosiAI 开源了一个0.9B的小模型,能一次性转录90分钟的多说话人音频,边缘设备就能跑,很适合本地部署。原文稍后读已读值得跟进有用关注 MOSS-Transcribe-Diarize-0.9B
22:15官方账号LMSYS Org (SGLang)@lmsysorg精选Netpreme发布博客,介绍将X-Mem MPU插入SGLang HiCache的分层KV缓存方案。在SWE-bench的Claude Code多轮编码中,前缀缓存命中率平均达98%。用X-Mem替换主机DRAM作为卸载层级后,TTFT降低6.7倍,每用户TPS提升33-50%,系统吞吐量提升30%。该方案通过HiCache的分层接口实现即插即用。AI模型NetpremeX-MemSGLang推荐理由:Netpreme的X-Mem内存插进SGLang的HiCache,多轮对话缓存带宽不再是瓶颈,TTFT降6.7倍,吞吐量涨30%,实测SWE-bench效果显著。原文稍后读已读值得跟进有用关注 Netpreme
16:29AI Will@FinanceYF5第三方服务商通过SGLang推理引擎、Prefill-Decode解耦架构、专家并行技术及AMD MI300 GPU,将DeepSeek模型的API调用成本降至官方价格的1/5。该技术栈组合显著降低了推理开销,使小型团队和企业能以更低成本使用高性能模型。方案中涉及的专家并行与Prefill-Decode分离是核心优化手段。技巧DeepSeekSGLangAMD MI300推荐理由:想低成本跑DeepSeek?有第三方用SGLang和AMD MI300把API成本压到官方的五分之一,技术方案公开,值得参考。原文稍后读已读值得跟进有用关注 DeepSeek
16:09AI Will@FinanceYF573°xAI SGLang负责人在23分钟演讲中详解如何在10万张GPU上部署Grok模型。他们通过拆分Prefill与Decode阶段,将MoE专家分片到不同GPU。采用按专家路由Token的方式让通信与计算重叠执行。最终以低于DeepSeek API的定价对外提供服务。技巧xAIGrokSGLang推荐理由:想了解超大规模GPU集群如何搞推理?xAI的SGLang负责人手把手教你拆分、分片和通信重叠,还比DeepSeek API更便宜。原文稍后读已读值得跟进有用关注 xAI
02:05官方账号LMSYS Org (SGLang)@lmsysorg精选SGLang现支持DSpark算法,通过置信度驱动的变长验证优化推测解码。与传统验证所有候选token不同,DSpark仅验证高置信度token,在批大小1-256的DeepSeek-V4-Flash上实现最佳吞吐延迟权衡,优于MTP和非推测解码方案。高并发下动态调度相比固定预算带来约20%吞吐提升。使用融合内核和零开销调度后,DeepSeek-V4-Pro在B300上达到383.7 tok/s。AI模型SGLangDSparkDeepSeek-V44 个信源在谈事件专题推荐理由:SGLang加入DSpark后,高并发场景下吞吐能提升20%,在DeepSeek-V4上实测383.7 tok/s,推理优化党可以试试。原文稍后读已读值得跟进有用关注 SGLang
02:03官方账号LMSYS Org (SGLang)@lmsysorg76°腾讯混元发布Hy3,一个295B参数MoE模型,激活参数仅21B,支持256K上下文。在推理和智能体任务上,Hy3可媲美参数大2-5倍的开源模型。通过反幻觉训练,该模型的幻觉率从12.5%降至5.4%。多轮意图跟踪指标MRCR从42.9%提升至75.1%。Hy3支持MTP+EAGLE推测解码,并提供了FP8检查点以降低部署成本。AI模型Hy3TencentHunyuanSGLang推荐理由:腾讯混元新模型Hy3,21B激活参数就能比肩更大模型,幻觉率从12.5%降到5.4%,多轮对话能力大增,现在就能在SGLang上跑。原文稍后读已读值得跟进有用关注 Hy3
04:51官方账号LMSYS Org (SGLang)@lmsysorg精选SGLang团队发布博客,介绍如何将基准测试、性能分析和内核优化知识转化为可执行的Agent技能。通过allreduce融合,Qwen3-Next吞吐量提升71.4%,TTFT从456ms降至168ms。路由token化去重使长上下文提示的TTFT降低29-49%。Spectral Progressive Diffusion实现2.32倍扩散去噪加速;KDA-Pilot在10个B200内核任务上获得1.13-2.75倍加速,3个PR已合并。LTX-2 VAE解码加速1.41倍,峰值内存节省9.7 GiB,所有改进均通过严格验证。AI模型SGLangQwen3-Next智能体推荐理由:SGLang团队用Agent自动化优化推理管道,实测吞吐涨71%,TTFT砍半,还省了10GB显存,硬核经验值得看。原文稍后读已读值得跟进有用关注 SGLang
23:30官方账号LMSYS Org (SGLang)@lmsysorgLaguna XS 2.1是poolside推出的33B总参数MoE模型,专为agentic coding和长时任务设计,已获SGLang Day-0支持。模型采用混合SWA+全局注意力(40层中3:1比例)与sigmoid门控,支持FP8 KV缓存和262K上下文,可在36GB RAM的Mac上运行。在SWE-bench Verified上达到70.9%,SWE-bench Multilingual相比XS 2提升5.4%。AI模型Laguna XS 2.1poolsideSGLang推荐理由:poolside新出的Laguna XS 2.1,33B MoE专为编程智能体设计,SWE-bench 70.9%还支持Mac本地跑,值得编程党试试原文稍后读已读值得跟进有用关注 Laguna XS 2.1
23:29官方账号LMSYS Org (SGLang)@lmsysorg76°NVIDIA推出Qwen3.6-27B-NVFP4模型,采用4位浮点量化,模型大小仅为BF16版本的约1/2.5。该模型在MMLU Pro基准上达到86.3分,与FP8版本性能几乎无损。上下文长度完整保留262K。SGLang已提供Day-0支持,并附带cookbook。AI模型Qwen3.6-27B-NVFP4NVIDIASGLang9 个信源在谈事件专题推荐理由:NVIDIA新出的Qwen3.6-27B模型,4位量化体积小很多但精度没怎么降,SGLang直接就能用,可以去试试。原文稍后读已读值得跟进有用关注 Qwen3.6-27B-NVFP4
00:09官方账号LMSYS Org (SGLang)@lmsysorg精选73°LMSYS 发文感谢 NVIDIA 在其最新推理软件经济学报告中提及 SGLang。SGLang 推出针对 Blackwell 架构的 day-0 优化方案,将 DeepSeek V4 的推理性能提升最高 5 倍。该优化通过 CUDA 原生推理路径实现,显著降低了每 token 成本。NVIDIA AI 团队与 SGLang 合作的具体技术细节已在博客中公开。AI模型SGLangNVIDIADeepSeek V48 个信源在谈事件专题推荐理由:SGLang 和 NVIDIA 联手让 DeepSeek V4 在 Blackwell 上跑得快了 5 倍,开源推理引擎的效率又上了一个台阶。原文稍后读已读值得跟进有用关注 SGLang
00:46官方账号LMSYS Org (SGLang)@lmsysorg精选72°SGLang 集成百度无限 OCR 功能,通过参考滑动窗口注意力(R-SWA)替换传统解码注意力,使 KV 缓存大小在整个解码过程中保持恒定。该方案在单次前向传播中可处理最长 32K token 的文本,转录数十页文档。其高压缩率来自 DeepSeek OCR 编码器,且 R-SWA 方法可扩展至 ASR、翻译等任务。AI产品SGLangOCR百度推荐理由:SGLang 新功能无限 OCR 能一口气处理几十页文档,显存占用不变,比传统注意力省资源,适合长文档批量 OCR 场景。原文稍后读已读值得跟进有用关注 SGLang
21:13官方账号LMSYS Org (SGLang)@lmsysorg71°SGLang团队为DeepEP MoE引入两种调度时负载均衡器Waterfill和LPLB。Waterfill将共享专家工作分配到较轻的rank,在DeepSeek V3/R1上带来+1.48%到+4.66%的性能提升,V4 Flash吞吐量从49,253 tok/s增至51,677 tok/s。LPLB优化冗余路由专家副本的流量分配,在red16/red32配置下取得+0.84%到+7.34%的提升。两种方法均不改变模型语义,保持推理精度。AI产品SGLangDeepEPDeepSeek V3推荐理由:SGLang给DeepSeek模型加了两个新负载均衡器,跑DeepSeek V3/R1速度能快最多7%,而且不改精度,想加速推理的可以试试。原文稍后读已读值得跟进有用关注 SGLang
21:12官方账号LMSYS Org (SGLang)@lmsysorg精选英伟达与智谱AI合作,发布了基于GLM-5.2的NVFP4量化检查点。该模型为744B参数混合专家架构(40B活跃参数),专注于推理和编码任务。NVFP4量化通过NVIDIA Model Optimizer实现,在降低内存占用的同时保持前沿推理性能。模型还支持稀疏注意力和IndexShare索引器,实现高效长上下文处理。目前已在Blackwell/Grace Blackwell上通过SGLang提供首日支持。AI模型GLM-5.2NVFP4NVIDIA5 个信源在谈事件专题推荐理由:英伟达把GLM-5.2压缩成NVFP4,内存省一大截,推理编码在Blackwell上直接跑,SGLang第一时间就能用。原文稍后读已读值得跟进有用关注 GLM-5.2
21:12官方账号LMSYS Org (SGLang)@lmsysorg精选Liquid AI 发布了 LFM2.5-230M 模型,参数规模仅 230M,是其最小模型。该模型基于 LFM2 架构,专为设备端部署设计,推理速度极快。它可在云端 GPU 和低成本 CPU 上运行,并支持工具调用和结构化数据提取。性能超过两倍参数量的模型,且已获 SGLang 的 Day 0 支持。AI模型LFM2.5-230MLiquid AISGLang推荐理由:Liquid AI 新出的 230M 小模型,跑得飞快,还能干工具调用的活,比两倍大的模型还强。原文稍后读已读值得跟进有用关注 LFM2.5-230M
01:02官方账号LMSYS Org (SGLang)@lmsysorg79°与NVIDIA合作,在GB300上使用SGLang服务DeepSeek-V4,实现5倍吞吐量提升(~2,200→~11,200 tok/s/GPU,交互性~50 tok/s/user)。借助MTP,在80 tok/s/user交互性下吞吐再提升2.6倍。Blackwell Ultra聚合模式下30 tok/s/user时吞吐提升2.91倍,峰值无MTP吞吐提升超6倍。采用W4A4 MegaMoE量化(MXFP4)且精度损失可忽略。单个FP8-einsum修复将MTP接受率从0.57提至0.70。AI模型DeepSeek-V4GB300SGLang8 个信源在谈事件专题推荐理由:想用SGLang在GB300上榨干DeepSeek-V4?NVIDIA合作实测,吞吐翻5倍,交互延迟不变,MTP和量化细节全公开。原文稍后读已读值得跟进有用关注 DeepSeek-V4
01:01官方账号LMSYS Org (SGLang)@lmsysorg精选Krea 2 是由 Krea AI 推出的开源文本到图像模型,在独立评测机构 Artificial Analysis 上排名第一。它包含两个版本:RAW 为未蒸馏基座检查点,适合微调和 LoRA 训练;Turbo 为 8 步蒸馏检查点,实现快速高质量生成。用户可在 RAW 上训练 LoRA,在 Turbo 上进行推理,并已获得 SGLang 的 Day-0 支持。AI模型Krea 2SGLangRAW推荐理由:Krea 2 开源了双版本,RAW 用来训练 LoRA,Turbo 跑推理,直接用 SGLang 就能跑,比闭源模型更灵活。原文稍后读已读值得跟进有用关注 Krea 2
16:43官方一手pandaily@contact@pandaily.com (Pandaily)摩尔线程与 SGLang 社区在首次线下见面会上宣布,MUSA 后端已合并入 SGLang 主线。该合并使 SGLang 能够原生支持摩尔线程 GPU,不再依赖 CUDA。此次 Meetup 聚焦中国开源 AI 生态的 GPU 兼容性与性能优化。此举为国内开发者提供了更低门槛的国产 GPU 推理方案。行业SGLangMUSA摩尔线程推荐理由:想用国产GPU跑大模型?摩尔线程和SGLang把MUSA后端合到主线了,以后直接用,不用再折腾CUDA转译。原文稍后读已读值得跟进有用关注 SGLang
01:54官方账号LMSYS Org (SGLang)@lmsysorgpoolside发布的Laguna M.1是一个225B参数的MoE模型,专为智能体编码和长期任务设计。该模型采用70层结构:3个密集SwiGLU层加67个稀疏MoE层,共有256个专家,top-k=16且使用无辅助损失负载均衡。它在所有层使用全局注意力:64个Q头、8个KV头,以及softplus输出门控。Laguna M.1支持原生交错推理:在工具调用之间进行思考,并可每个请求切换。在SWE-bench Verified、SWE-bench Multilingual、SWE-Bench Pro和Terminal-Bench 2.0上表现强劲。现在可通过SGLang运行。AI模型Laguna M.1poolsideSGLang2 个信源在谈事件专题推荐理由:poolside刚发的225B MoE模型Laguna M.1,专为智能体编码设计,SGLang直接跑起来了,在SWE-bench上很强。原文稍后读已读值得跟进有用关注 Laguna M.1
23:06官方账号LMSYS Org (SGLang)@lmsysorg精选Zai_org 发布了新旗舰模型 GLM-5.2,支持 1M token 长上下文。在 Terminal-Bench 2.1 上,GLM-5.2 得分 81.0,相比 GLM-5.1 的 62.0 提升明显。IndexShare 机制在 1M 上下文下将每 token 的 FLOPs 降低了 2.9 倍,改进的 MTP 将投机解码接受率提升了 20%。该模型在 SGLang 中已获得即日支持。AI模型GLM-5.2Zai_orgSGLang推荐理由:Zai_org 的 GLM-5.2 来了,1M 长上下文拿下了 81.0 的 Terminal-Bench 分数,比上一代高出一截,而且推理效率也优化了,值得上手试试。原文稍后读已读值得跟进有用关注 GLM-5.2
02:16官方账号LMSYS Org (SGLang)@lmsysorg76°LMSYS 发布博客介绍 DFlash 和 Spec V2 推测解码技术。在 8 块 B200 上,针对 HumanEval 基准,DFlash + Spec V2 实现超过 4.3 倍基线吞吐量和 1.5 倍原生 MTP 吞吐量。其核心包括块扩散起草器(一次前向传播生成完整 token 块)和 KV 注入(目标模型特征馈入每层 KV 缓存),以及 Spec V2 重叠调度器带来 33% 端到端提升。该方案现已作为 SGLang 的默认推测解码引擎。AI模型DFlashSpec V2SGLang推荐理由:LMSYS 和 Modal 联手推出了 DFlash,让 Qwen 3.5 的推理速度比原生 MTP 快 1.5 倍,比基线快 4.3 倍,代码已开源,玩起来!原文稍后读已读值得跟进有用关注 DFlash
13:11官方账号LMSYS Org (SGLang)@lmsysorg精选73°SGLang在NVIDIA GB300 NVL72平台上,针对DeepSeek V4 Pro 1.6T模型(FP4精度,8K/1K上下文)实现了每GPU超过12K tok/s的推理速度。该性能由NVIDIA Dynamo(SGLang)和MTP技术协同实现。根据SemiAnalysis InferenceX基准测试,该性能在整个交互性曲线上保持稳定。AI模型SGLangGB300 NVL72DeepSeek V4 Pro10 个信源在谈事件专题推荐理由:SGLang在GB300上跑DeepSeek V4 Pro,每GPU超1.2万token原文稍后读已读值得跟进有用关注 SGLang
22:18官方账号LMSYS Org (SGLang)@lmsysorg73°SGLang 宣布 Day-0 支持 MiniMax-M3,这是 MiniMax 推出的原生多模态 MoE 推理模型,总参数量约 428B(活跃参数约 23B),支持文本、图像和视频的融合处理。M3 采用 MiniMax 稀疏注意力机制,在 1M 上下文下相比 M2 实现 9 倍预填充和 15 倍解码加速,每 token 计算量降至 1/20。该模型在编码和协作任务上达到前沿智能体性能,并原生支持 NVIDIA Blackwell 和 AMD MI350X/MI355X 上的 MXFP8 格式。开发者可通过 SGLang 立即运行该模型。AI模型SGLangMiniMax-M3多模态10 个信源在谈事件专题推荐理由:SGLang 第一时间支持 MiniMax-M3,做多模态推理和长上下文应用的团队可以直接上手体验 428B 模型的稀疏注意力加速,编码和智能体任务表现值得一试。原文稍后读已读值得跟进有用关注 SGLang
12:04官方账号LMSYS Org (SGLang)@lmsysorg精选SGLang 宣布 Day-0 支持 Google 的 DiffusionGemma 模型,这是 Gemma 4 的文本扩散变体(26B A4B MoE)。与传统逐 token 解码不同,DiffusionGemma 通过并行去噪 token 块实现极低批处理生成速度。该模型支持离散文本扩散、多模态输入(文本、图像、视频)输出文本、稀疏 MoE 架构(8/128 专家)以及可配置思考模式。开发者现在即可通过 SGLang 运行该模型。AI模型SGLangDiffusionGemmaGemma 47 个信源在谈事件专题推荐理由:文本扩散模型大幅提升生成效率,适合需要低延迟批量推理的 AI 应用开发者,建议立即在 SGLang 中体验。原文稍后读已读值得跟进有用关注 SGLang
02:01官方账号阶跃星辰 Stepfun@Stepfun_AIStepFun 与 Modal 合作,发布了在 Modal 无服务器 AI 平台上部署 Step 3.7 Flash 模型的指南。该方案使用 8×H100 GPU、Modal Volumes 和 SGLang,提供 OpenAI 兼容的聊天补全端点。开发者无需管理基础设施即可快速部署和扩展推理工作负载。这降低了 StepFun 开源模型的使用门槛,让更多构建者能轻松调用。AI产品Step 3.7 FlashModalSGLang10 个信源在谈事件专题推荐理由:想低成本部署开源推理模型的团队,现在可以直接在 Modal 上跑 Step 3.7 Flash,免去 GPU 管理烦恼,还自带 OpenAI 兼容接口,建议试试。原文稍后读已读值得跟进有用关注 Step 3.7 Flash