8月7日
01:20
01:20Geek@geekbb
精选71°
Unsloth AI推出DSpark加速方案,让DeepSeek-V4-Flash-0731的GGUF模型在本地生成速度提升约1.4至2倍。根据Unsloth官方实测,该模型在本地可达到每秒120 tokens,精度没有变化。相关GGUF文件已发布在Hugging Face上,完整指南见Unsloth官方文档。
事件专题

推荐理由:Unsloth搞了个DSpark,能让DeepSeek-V4-Flash在本地跑快一两倍,每秒120 tokens,精度不变,自己部署更爽了。
7月14日
02:17
02:17官方账号vLLM@vllm_project
精选
Novita Labs 训练并开源了 DSpark 投机解码器,用于 Kimi-K2.6 和 Kimi-K2.7-Code 模型。DSpark 是 DeepSeek 提出的投机解码方法,能一次性生成整个 token 块。vLLM 从 v0.25.0 版本起原生支持 DSpark。使用该解码器可加快 Kimi 系列的推理速度。
推荐理由:DeepSeek 的 DSpark 投机解码,能让 Kimi-K2.6 和 K2.7-Code 一次生成整块 token,配合 vLLM 0.25.0 原生支持,解码更快。
7月7日
11:49
11:49官方一手arXiv: DeepSeek@Xin Cheng, Xingkai Yu, Chenze Shao, Jiashi Li, Yunfan Xiong, Yi Qian, Jiaqi Zhu, Shirong Ma, Xiaokang Zhang, Jiasheng Ye, Qinyu Chen, Chengqi Deng, Jiping Yu, Damai Dai, Zhengyan Zhang, Yixuan Wei, Yixuan Tan, Wenkai Yang, Runxin Xu, Yu Wu, Zhean Xu, Xuanyu Wang, Muyang Chen, Rui Tian, Xiao Bi, Zhewen Hao, Shaoyuan Chen, Huanqi Cao, Wentao Zhang, Anyi Xu, Huishuai Zhang, Dongyan Zhao, Wenfeng Liang
76°
DSpark是一种新型投机解码框架,通过半自回归架构(并行骨干网络+轻量级顺序模块)保持草稿质量,缓解后缀衰减。它采用置信度调度验证,根据前缀存活概率和引擎吞吐量动态调整每轮验证长度。在离线多领域基准测试中,DSpark的接受长度显著优于现有自回归和平行草稿器。在DeepSeek-V4服务系统的真实用户流量下,相比生产基线MTP-1,DSpark在维持吞吐量不变时单用户生成速度提升60%至85%。DSpark还通过防止高并发下吞吐量严重退化,使服务系统达到了此前无法实现的性能层级。
推荐理由:DeepSeek-V4搞了个新框架DSpark,把生成和验证分开调度,用户实际体验加速60%到85%,还不会拖慢系统吞吐。
6月30日
6月29日
15:19
15:19Geek@geekbb
推文作者分享了使用 Qwen3-8B 模型与 DSpark 工具进行本地部署的体验。该推文获得 737 次查看,反映了用户对消费级显卡运行大模型的渴望。当前消费级显卡显存普遍不足,难以直接运行 8B 参数模型。

推荐理由:有人实测了 Qwen3-8B 配合 DSpark 本地跑,说能流畅运行但显存不够,感觉消费级显卡该升级了。
6月28日
16:36
16:36官方一手Pandaily@contact@pandaily.com (Pandaily)
76°
北京大学与DeepSeek联合开源了投机解码框架DSpark,该框架无需修改模型即可将LLM推理速度提升60-85%。在严格延迟约束下,吞吐量增益最高达661%。DSpark通过高效的投机解码策略显著降低推理延迟。这一成果已在GitHub上开源。

推荐理由:北大和DeepSeek搞的DSpark,不用改模型就能让推理快80%,吞吐量翻好几倍,适合做部署的试试。
13:11
13:11官方一手pandaily@contact@pandaily.com (Pandaily)
DeepSeek 发布 DSpark 推测解码框架,可将文本生成速度提升 80%。该框架优化推理效率,标志着 AI 竞争焦点从训练规模转向实际部署。DSpark 采用推测解码技术,通过小模型草稿加速大模型生成。

推荐理由:DeepSeek 的 DSpark 框架让模型生成快八成,推理部署更省算力,搞推理优化的可以看看。