事件专题 · 多源确认

SGLang集成DSpark:置信度驱动变长验证提升推测解码吞吐

SGLang现支持DSpark算法,通过置信度驱动的变长验证优化推测解码。与传统验证所有候选token不同,DSpark仅验证高置信度token,在批大小1-256的DeepSeek-V4-Flash上实现最佳吞吐延迟权衡,优于MTP和非推测解码方案。高并发下动态调度相比固定预算带来约20%吞吐提升。使用融合内核和零开销调度后,DeepSeek-V4-Pro在B300上达到383.7 tok/s。

当前结论

SGLang加入DSpark后,高并发场景下吞吐能提升20%,在DeepSeek-V4上实测383.7 tok/s,推理优化党可以试试。

5 个信源59° AI 热度最后更新 2026/7/6 18:05:13

证据链

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情