22:28techcrunch@Russell Brandom78°OpenAI的Jalapeño芯片在Semianalysis的InferenceX基准测试中,每用户处理的token数量和每千瓦时的吞吐量均超过现有最先进技术。AI模型OpenAIJalapeño芯片推理加速10 个信源在谈事件专题推荐理由:想了解OpenAI如何加速推理?Jalapeño芯片的表现值得关注。它比现有技术更快,值得一看。原文稍后读已读值得跟进有用关注 OpenAI
11:10官方账号arXiv cs.LG@Chengjie Lu, Tianchi Deng, Zhengqi He, Chengwen Luo, Xueliang LiChebBooster通过切比雪夫多项式理论实现训练免费的外推框架,为扩散Transformer(DiTs)提供稳定高效的加速。在DiT-XL/2、PixArt-$Σ$和FLUX.1-dev等三个代表性模型上,ChebBooster在视觉质量和推理效率上均取得显著提升,达到$3.68 imes$延迟速度提升和$5.12 imes$浮点运算减少,优于现有训练免费基线。论文ChebBooster扩散Transformer推理加速推荐理由:这篇论文提出了ChebBooster,一种基于切比雪夫多项式的训练免费外推框架,能显著提升扩散Transformer的推理效率,值得一看。原文稍后读已读值得跟进有用关注 ChebBooster
10:06官方一手arXiv: DeepSeek@Yuannuo Feng, Zegang Peng, Yuxin Xie, Yubing Ye, Yizhe Chen, Wenshuai Yao, Wenyong Zhou, Wang KangApproximate Speculative Decoding(ASD)是一种免训练的投机解码验证器,用预算化的最长前缀选择替代逐位截断,在保留目标贪心后缀的同时接受部分不匹配token。在Qwen3-14B+DSpark-14B的七项任务上,ASD相比严格验证平均提升7.78%吞吐,区间为3.05%到15.26%。在FP4到FP8兼容设置下,DeepSeek-V4-Flash(284B)搭配DSpark时,GSM8K和MATH-500上的验证方接受率提高约10%到16%。该方法无需新草稿模型或微调,预算为零时精确退化为标准贪心验证,代码已开源。论文ASD投机解码Qwen3-14B7 个信源在谈事件专题推荐理由:这篇论文搞了个叫ASD的投机解码改进,不用重新训练就能提速,实测吞吐最高涨15%,代码也开源了,跑推理的可以看看。原文稍后读已读值得跟进有用关注 ASD
09:56官方一手arXiv: OpenAI@Shun-ichiro Hayashi, Daichi Mukunoki, Tetsuya Hoshino, Takahiro KatagiriATFlash 提出按 RoPE 每个频率分量的波长设定注意力距离窗口,对 Qwen2.5-0.5B 和 Llama-3.2-3B 可剪掉 37%–48% 的 query-key 内积项。与滑窗不同,低频分量仍能访问所有 key,剪枝率与输入无关,闭式复杂度随序列长度 N 对数增长。在 LongBench-v2 上 top-1 匹配率保持 96%–98%,输出分布 KL 在 10^-3 nat 量级;RULER、OpenAI-MRCR、LongCodeQA、∞Bench 分数基本不变。移植到 FlashAttention-4 和 FlashInfer 后,RTX PRO 6000 上 Llama 推理最高提速 1.29 倍(128K),Qwen2.5-7B-1M 在 1M token 上下文剪掉 57% 内积项,端到端提速 1.31 倍。论文ATFlashRoPEFlashAttention3 个信源在谈事件专题推荐理由:ATFlash 在 1M token 上下文把 Qwen2.5-7B 提速 1.31 倍,精度不掉,而且能直接叠加现有稀疏方法。原文稍后读已读值得跟进有用关注 ATFlash
21:23Hunyuan@TXhunyuan精选72°腾讯混元开源了AngelSpec,一个端到端的投机解码框架,同时支持训练和部署。在Hy3-A21B模型上,DFly方法在并发数4到64范围内,相比自回归解码实现1.98到2.40倍的端到端加速。与DFlash相比,DFly的吞吐量高出10.5%到11.8%。项目提供了训练代码、Hy3-A21B MTP/DFly drafter权重,以及论文和文档。AI模型AngelSpecDFlyTencent Hunyuan推荐理由:腾讯混元开源了AngelSpec,一个能帮你的模型推理提速近2倍的投机解码框架,实测比DFlash还快10%以上,代码和权重都直接可用了。原文稍后读已读值得跟进有用关注 AngelSpec
12:32官方一手arXiv: DeepSeek@Dengke Han精选DraftExpert针对在端侧设备(CPU-GPU或Flash-NPU卸载)部署大型MoE语言模型时的延迟问题,提出了一种扩展感知的自推测解码框架。它通过自蒸馏从冻结目标MoE中为每层训练一个轻量级驻留加速器的草稿专家,推理时使用固定足迹的共享+top-1+草稿专家解码器,结合置信度扩展截断和目标专家预取。在DeepSeek-V2-Lite和Moonlight-16B-A3B上,解码吞吐量平均提升1.45倍,草稿接受率达到84%~87%,预取命中率86%~88%。论文DraftExpertMoE自推测解码推荐理由:论文提出DraftExpert,通过训练轻量草稿专家和预取机制,让端侧MoE模型推理速度提升1.45倍,适合关注边缘部署和推理加速的朋友。原文稍后读已读值得跟进有用关注 DraftExpert
16:21官方一手Pandaily@contact@pandaily.com (Pandaily)Lightelligence 在 WAIC 2026 上展示了全球首个实际部署的光计算系统——天书光立方门禁控制。该公司同步发布 PACE 3 光芯片,其 256x256 光子矩阵用于低延迟推理任务。该芯片已在真实场景中运行,标志光计算从实验室走向商业化。PACE 3 的光子矩阵设计相比传统电子芯片在功耗和延迟上有数量级优势。AI模型LightelligencePACE 3光子芯片推荐理由:Lightelligence 把光计算从论文带到了真实门禁系统里,PACE 3 芯片的 256x256 矩阵能跑低延迟推理,是商用落地的首个案例,值得关注。原文稍后读已读值得跟进有用关注 Lightelligence
23:04techcrunch@Julie BortEtched由三位哈佛辍学生创立,开发了新型芯片和内存组件,声称可加速任何AI模型的推理过程,无需GPU。该公司最新估值达到103亿美元,吸引了多位知名投资者。这一成绩挑战了传统AI芯片市场格局。行业Etched哈佛AI芯片2 个信源在谈事件专题推荐理由:Etched做了不用GPU的AI推理芯片,三位哈佛辍学生搞出了103亿美元估值,和英伟达路线不同,挺有意思。原文稍后读已读值得跟进有用关注 Etched
22:38官方账号LMSYS Org (SGLang)@lmsysorg精选Miles 框架新增 On-Policy Distillation(OPD)作为一等训练原语。在 Qwen3.5-35B-A3B 上,纯 OPD 使推理 token 数从 18.6k 降至 5.5k–6.7k,缩短约 3 倍,同时 held-out DAPO 准确率从 0.8457 升至 0.8945。反向 KL 散度从 0.045 降至 0.010,学生模型收敛至教师。采用稀疏逐位置评分代替密集 O(R²K) 评分,提升效率。支持纯蒸馏或与 GRPO/PPO 奖励结合,计划扩展多教师和 RL 场景。AI模型MilesOPDQwen3.5-35B1 个信源在谈事件专题推荐理由:Miles 发布了 OPD 方法,让 Qwen3.5 模型推理更快更准,无需任务奖励,比传统蒸馏更高效,适合模型压缩场景。原文稍后读已读值得跟进有用关注 Miles
16:06IT之家(博客/媒体)精选东擎与荷兰AI芯片企业Axelera AI达成战略合作,在其边缘AI平台集成Metis AIPU加速器。Metis AIPU采用三星5nm工艺,功耗8-15W,可额外提供至高214 TOPS的INT8推理算力。相比传统GPU,Metis在AI推理性能上更优,功耗与TCO更低。合作旨在简化AI从开发、验证到部署的流程,加速边缘智能应用落地。AI产品东擎Axelera AIMetis推荐理由:东擎联手Axelera AI,边缘设备轻松加上214 TOPS算力,功耗低至8W,部署AI更省心了。原文稍后读已读值得跟进有用关注 东擎
12:00IT之家(博客/媒体)芯展速在 WAIC 2026 展出 AI90 软硬件一体化推理加速方案,将高性能 SSD 纳入 GPU 显存体系,形成 HBM+DRAM+SSD 三级存储。该方案将首 Token 延迟从秒级降至亚秒级,提速 50 倍,吞吐量提升 5.1 倍,显存节省 39%。针对 8 卡 NVIDIA GeForce RTX 5090 集群,推理加速达 5.8 倍,支持 128K+ 上下文。配套 PT200Z AI SSD 采用 pSLC 闪存与 PCIe Gen5 接口,顺序读取 14.8GB/s,随机读取 3100K IOPS,读取时延 54μs。AI产品芯展速AI90PT200Z6 个信源在谈事件专题推荐理由:芯展速用SSD给显卡做显存扩展,首Token快了50倍,8卡RTX 5090集群也能跑128K上下文,适合长文本推理场景。原文稍后读已读值得跟进有用关注 芯展速
10:46官方一手arXiv: DeepSeek@Ziqi Yin, Jianyang Gao, Peiqi Yin, Jiangneng Li, Gao CongLiteTopK是一种针对长上下文稀疏注意力中Indexer-TopK操作的高效融合内核。它利用高维空间中向量距离集中在狭窄范围的特性,通过采样小部分数据估计查询-数据分数范围,并在线将候选结果分桶。该设计减少了全局内存流量和同步开销,同时保持精确Top-k正确性。实验在GLM 5.2的预填充阶段实现1.2倍加速,内存开销更低。论文LiteTopKGLM 5.2稀疏注意力推荐理由:这个新方法挺聪明,用高维空间特性优化注意力计算,在GLM 5.2上实测提速1.2倍还省内存。原文稍后读已读值得跟进有用关注 LiteTopK
09:46官方一手arXiv: DeepSeek@Jincheng Xie, Runheng Liu, Heyan Huang, Yawen Ling, Hanbin Dai, Yu Zheng, Wen Hu精选稀疏混合专家(MoE)模型在扩展LLM时依赖专家激活模式,现有投机解码忽视专家激活成本,导致专家散射增加内存流量。EcoSpec通过轻量级专家预测器和动态专家缓冲区,在保持高接受率前提下优先复用了当前验证集的专家路径。在DeepSeek-V3.1(671B)、Qwen3-235B-A22B、GPT-OSS-120B三个大规模MoE模型上,于推理、编码、问答和对话基准测试中,EcoSpec持续减少活跃专家足迹,最高实现1.62倍解码速度提升。论文EcoSpecMoE投机解码推荐理由:这篇论文提出EcoSpec,在DeepSeek-V3.1等MoE模型上通过成本感知投机解码最高提速1.62倍,值得关注。原文稍后读已读值得跟进有用关注 EcoSpec
20:29官方账号vLLM@vllm_project精选72°Cohere 团队开发了硬件感知的动态投机解码(Dynamic SD)并合并到 vLLM 项目。传统方法使用固定数量的草稿 token,而 DSD 会根据批次大小和硬件自适应调整。在有利场景下实现加速,在不利场景下回退以保持性能。该更新提升了 vLLM 在推理时的效率。AI模型CoherevLLMDynamic SD推荐理由:vLLM 合并了 Cohere 的动态投机解码,能根据硬件和批次大小自适应,想提升推理速度的可以试试。原文稍后读已读值得跟进有用关注 Cohere
06:22官方账号Clement Delangue@ClementDelangue精选Hugging Face 与 Google Gemma 联合举办的 Gemma Challenge 结果出炉。超过100个 AI agent 和人类在6天内协作,将 Gemma 4 推理速度在单张 NVIDIA A10G GPU 上提升5倍,达到491.8 TPS(最快但有质量损失),无损方案达315 TPS。项目展示了多智能体协作优化模型推理的潜力。AI模型Gemma 4Hugging Face推理加速8 个信源在谈事件专题推荐理由:Hugging Face 和 Google 搞了个挑战赛,100多个 AI agent 和人类一起把 Gemma 4 推理速度在单张 A10G 上提升了5倍,最快冲到491.8 TPS,挺酷的。原文稍后读已读值得跟进有用关注 Gemma 4
23:28官方一手AWS Machine Learning Blog@Xuan Lu精选本教程展示了如何在Amazon SageMaker HyperPod上使用vLLM实现DPD(分离预填充和解码)。DPD通过将预填充阶段和解码阶段分别部署在不同的计算节点上,显著降低了推理延迟。文中提供了使用HyperPod推理操作符的具体配置步骤和性能对比数据。该方法适用于需要低延迟响应的LLM推理场景。技巧SageMaker HyperPodvLLMDPD推荐理由:AWS教你用vLLM在SageMaker HyperPod上把LLM推理分成两段跑,延迟更低,实操步骤写得挺清楚。原文稍后读已读值得跟进有用关注 SageMaker HyperPod
10:11IT之家(博客/媒体)谷歌推出LiteRT.js库,基于WebAssembly并利用WebGPU与WebNN硬件加速。该库旨在替代TensorFlow.js的JavaScript内核方案。在搭载M4芯片的2024款MacBook Pro上,LiteRT.js推理速度较现有方案提升3倍。谷歌表示在旧硬件或不同引擎浏览器上性能可能存在差异。AI产品LiteRT.js谷歌WebAssembly推荐理由:谷歌出了个LiteRT.js,用WebAssembly让浏览器跑AI比TensorFlow.js快3倍,尤其在M4 MacBook上效果明显。原文稍后读已读值得跟进有用关注 LiteRT.js
19:20官方账号vLLM@vllm_project精选76°vLLM与Hugging Face团队在v0.25.0中实现了Transformers建模后端与手写vLLM模型的对等性能。现在450多种Transformers架构可以直接在vLLM中以原生速度运行,完全无需移植代码。用户只需集成一次Transformers即可自动获得vLLM的融合内核、torch.compile和CUDA图优化。这一更新大幅降低了在vLLM上使用新模型的工程成本。AI产品vLLMHugging FaceTransformers推荐理由:vLLM和Hugging Face搞了个大活:Transformers v0.25.0直接兼容vLLM,450多个模型自动加速,不用自己写适配代码了,开箱即用!原文稍后读已读值得跟进有用关注 vLLM
16:44IT之家(博客/媒体)NVIDIA 正与 ASIC 初创企业 d-Matrix 合作,将 Hopper/Blackwell GPU 与 d-Matrix 的 Corsair ASIC 结合形成混合算力基础设施。Parasail 通过该组合实现了 10 倍的 Token 生成速率。Corsair 采用台积电 N6 制程 D-IMC 架构,集成计算单元和足量 SRAM 降低数据开销。方案中 GPU 负责推理前端的预填充任务,Corsair 处理延迟敏感的解码任务。行业NVIDIAd-MatrixCorsair10 个信源在谈事件专题推荐理由:NVIDIA 和 d-Matrix 搞了个混合算力方案,GPU 负责预填充、专用芯片负责解码,推理 Token 生成速度翻了 10 倍。不是单纯的拼硬件,是真正分工优化。原文稍后读已读值得跟进有用关注 NVIDIA
16:35techcrunch@Anna HeimZML是一家由图灵奖得主Yann LeCun背书的法国AI初创公司,近期推出免费产品ZML/LLMD。该软件旨在加速AI推理过程,特别是在大量AI芯片上运行时的效率。通过优化推理速度,ZML/LLMD有望降低AI部署的计算成本。AI产品ZMLZML/LLMDYann LeCun推荐理由:ZML这波免费发布推理加速软件,能让多芯片推理跑得更快、更省钱,尤其适合做大规模部署的人。原文稍后读已读值得跟进有用关注 ZML
12:19官方账号arXiv cs.AI@Anna Cordoba, Adam Puente Tercero, Nerea Angulo Hijo, Mar Linares Tercero, Julia Barrientos, Ainhoa Miranda, Jesus OliveraDepthWeave-KV是一种跨层键值缓存压缩方法,通过共享低秩通道基分解相邻层状态,保留令牌特定残差。它使用令牌条件深度路由器为指令型和检索关键令牌分配更高重构秩,并通过注意力输出探头在线追踪误差自适应压缩。在LongBench等基准上,DepthWeave-KV实现近满缓存任务质量,压缩比达8.3倍,64K上下文速度72.8 tokens/s。论文DepthWeave-KVKV缓存压缩长上下文推荐理由:长上下文推理内存瓶颈有救了!DepthWeave-KV用跨层分解加自适应压缩,8.3倍KV缓存缩减,速度72.8 tokens/s,比其他方法效果更好。原文稍后读已读值得跟进有用关注 DepthWeave-KV
16:51@koltregaskes@koltregaskes73°OpenAI 宣布其大型模型 GPT-5.6 Sol 将在 Cerebras 硬件上提供推理服务,速度高达 750 tokens 每秒。官方表示该版本与原始模型“相同”,但可能在上下文窗口大小等参数上有调整。该部署预计显著提升推理效率,适用于高吞吐场景。AI模型GPT-5.6 SolOpenAICerebras10 个信源在谈事件专题推荐理由:OpenAI 把 GPT-5.6 Sol 放到 Cerebras 上跑,推理速度飙到 750 tokens/s,比常规部署快很多,适合追求低延迟的场景。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
11:49官方一手arXiv: DeepSeek@Xin Cheng, Xingkai Yu, Chenze Shao, Jiashi Li, Yunfan Xiong, Yi Qian, Jiaqi Zhu, Shirong Ma, Xiaokang Zhang, Jiasheng Ye, Qinyu Chen, Chengqi Deng, Jiping Yu, Damai Dai, Zhengyan Zhang, Yixuan Wei, Yixuan Tan, Wenkai Yang, Runxin Xu, Yu Wu, Zhean Xu, Xuanyu Wang, Muyang Chen, Rui Tian, Xiao Bi, Zhewen Hao, Shaoyuan Chen, Huanqi Cao, Wentao Zhang, Anyi Xu, Huishuai Zhang, Dongyan Zhao, Wenfeng Liang76°DSpark是一种新型投机解码框架,通过半自回归架构(并行骨干网络+轻量级顺序模块)保持草稿质量,缓解后缀衰减。它采用置信度调度验证,根据前缀存活概率和引擎吞吐量动态调整每轮验证长度。在离线多领域基准测试中,DSpark的接受长度显著优于现有自回归和平行草稿器。在DeepSeek-V4服务系统的真实用户流量下,相比生产基线MTP-1,DSpark在维持吞吐量不变时单用户生成速度提升60%至85%。DSpark还通过防止高并发下吞吐量严重退化,使服务系统达到了此前无法实现的性能层级。AI模型DSparkDeepSeek-V4投机解码推荐理由:DeepSeek-V4搞了个新框架DSpark,把生成和验证分开调度,用户实际体验加速60%到85%,还不会拖慢系统吞吐。原文稍后读已读值得跟进有用关注 DSpark
19:51量子位@量子位的朋友们精选73°阿里与清华团队在ICML 2025上发表极简方案,刷新扩散模型推理纪录。该方案大幅简化了扩散模型推理流程,实现了速度与质量的提升。论文被ICML评选为杰出论文。论文阿里清华ICML推荐理由:阿里和清华的新研究,用极简单的方法把扩散模型推理速度刷到新纪录,还拿了ICML杰出论文,搞生成模型的快看。原文稍后读已读值得跟进有用关注 阿里
20:30官方账号vLLM@vllm_project精选DeepSeek 的 DSpark 投机解码技术现已原生集成到 vLLM 推理框架中。DSpark 是一种半自回归草稿模型,通过非因果滑动窗口注意力并行生成多个 token,单次验证即可保持输出一致,减少解码步数。在 NVIDIA 8×B300 GPU 上,DeepSeek-V4-Pro-DSpark 在 batch size 1 时达到约 250 tokens/s,平均接受长度约 5,且在不同草稿深度下比 MTP 方法接受率高 12-42%。vLLM 通过复用 SparseMLA 后端、捕获完整草稿主干和采样循环到单一 CUDA graph,并支持前缀缓存和 FP8 KV cache。AI模型DeepSeekvLLMDSpark8 个信源在谈事件专题推荐理由:DeepSeek 把 DSpark 开源自带进 vLLM,跑 DeepSeek-V4 实测单卡 250 token/s,比 MTP 快 12-42%,想搞投机解码的可以试试。原文稍后读已读值得跟进有用关注 DeepSeek
07:33HeyGen@HeyGen_Official精选HeyGen Research开发了一个自主代理,将VAE解码器的推理速度提升了3倍。该代理在优化任务上超越了人类辅助优化方法。团队认为这种自动化优化应成为模型部署的新标准。完整技术报告已在heygen.com/research/auto-…发布。论文HeyGenVAEautonomous agent推荐理由:HeyGen用AI调AI,把VAE解码器跑快3倍,比人调的结果还强,搞模型部署的值得看一下。原文稍后读已读值得跟进有用关注 HeyGen
03:52官方账号NVIDIA AI@NVIDIAAI78°NVIDIA Research将30B参数的Nemotron-3-Nano-30B-A3B模型拆分为两半,一半维护上下文,一半生成token。该扩散语言模型仅复用预训练权重而非从头训练,在保持98.7%原始质量的同时实现了2.42倍的生成加速。这种方法将传统的自回归逐token生成改为并行写入,显著提升了推理效率。AI模型NemotronNVIDIA扩散语言模型7 个信源在谈事件专题推荐理由:NVIDIA把30B模型劈成两半,并行写token,速度翻倍还保质量,不是新训模型是复用预训练,挺聪明的做法。原文稍后读已读值得跟进有用关注 Nemotron
10:08官方账号arXiv cs.AI@Zhaoyang Luo, Runmin Dong, Miao Yang, Fan Wei, Yushan Lai, Bin Luo, Haohuan Fu论文提出一种操作级视觉令牌跳过框架,将Transformer层分解为注意力与FFN操作,选择性跳过冗余计算。实验覆盖3种MLLM架构(含Qwen3-VL)和10个VQA基准,实现精度-效率权衡:在Qwen3-VL上减少33.7% TFLOPs,保留99.5%的原始性能。关键发现是晚期视觉令牌更新对答案表示影响很小,且有效计算具有操作主导性和层依赖性。论文MLLMQwen3-VL推理加速推荐理由:这篇论文告诉你如何在不牺牲性能的前提下大幅降低多模态大模型的计算量。他们在Qwen3-VL上砍了33.7%的算力,性能只掉了0.5%,方法很巧妙。原文稍后读已读值得跟进有用关注 MLLM
02:48Amjad Masad@amasad精选AI推理成本高昂的原因之一是多数工作负载运行在预LLM时代的通用硬件上。Etched从隐身模式亮相,其系统专为现代推理从零设计。公司已获得超过10亿美元客户合同和8亿美元融资。早期测试显示,在推理工作负载上吞吐量、延迟和能效均达到SOTA。首批机架将于今年夏季发货。AI产品EtchedAI推理专用芯片5 个信源在谈事件专题推荐理由:Etched做了专为AI推理优化的芯片,比通用硬件在吞吐、延迟、能效上都做到了目前最好。今年夏天就发货,关注成本的人可以看看。原文稍后读已读值得跟进有用关注 Etched
06:35官方账号vLLM@vllm_projectvLLM 社区正在将 DeepSeek 的 DSpark 推测解码算法集成到 vLLM 推理引擎中。DSpark 是一种推测解码算法,能显著提升大语言模型的推理速度。该集成旨在为所有 vLLM 用户带来更快的推理性能,无需额外配置。目前社区正在积极开发中,预计将提升 vLLM 的吞吐量并降低延迟。AI模型vLLMDeepSeekDSpark推荐理由:vLLM 社区正在把 DeepSeek 的 DSpark 算法加进来,推理速度能再上一个台阶,用 vLLM 的朋友可以期待了。原文稍后读已读值得跟进有用关注 vLLM
13:11官方一手pandaily@contact@pandaily.com (Pandaily)DeepSeek 发布 DSpark 推测解码框架,可将文本生成速度提升 80%。该框架优化推理效率,标志着 AI 竞争焦点从训练规模转向实际部署。DSpark 采用推测解码技术,通过小模型草稿加速大模型生成。AI模型DeepSeekDSpark推理加速推荐理由:DeepSeek 的 DSpark 框架让模型生成快八成,推理部署更省算力,搞推理优化的可以看看。原文稍后读已读值得跟进有用关注 DeepSeek
11:19Geek@geekbb有传闻称DeepSeek官方V4 API在2024年8月上线两周后,便开始使用氮气加速技术DSpark。该说法源自社区讨论,目前官方未确认。DSpark是DeepSeek自主研发的推理加速方案,可降低延迟和成本。若属实,则V4 API在发布后快速引入了性能优化。AI产品DeepSeekV4DSpark推荐理由:听说DeepSeek V4 API悄悄用上DSpark加速了?上线才两周,这速度有点猛。原文稍后读已读值得跟进有用关注 DeepSeek
01:07官方一手marktechpost@Asif Razzaq79°DeepSeek开源了DSpark框架,通过将草稿模块附加到现有DeepSeek-V4权重上实现推测解码。它结合并行草稿骨干和轻量级马尔可夫头来减少后缀衰减,并加入基于置信度的调度验证,根据实时GPU负载调整检查token数量。离线测试中,接受长度相比DFlash和Eagle3提升16-31%;生产环境中每个用户生成速度比MTP-1基线提升57-85%,且无损。训练代码DeepSpec以MIT许可证开源。AI模型DSparkDeepSeek-V4DeepSeek1 个信源在谈事件专题推荐理由:DeepSeek搞了个DSpark,让V4推理速度翻倍,开源还无损,适合高并发场景。原文稍后读已读值得跟进有用关注 DSpark
15:30官方一手marktechpost@Asif Razzaq76°UC San Diego推出DFlash,用轻量级块扩散模型替代自回归起草器,实现投机解码。该方法通过单次前向传播生成整块token,并利用KV注入条件于目标隐藏特征。在Qwen3-8B上达到6.08倍无损加速,NVIDIA报告在Blackwell上固定交互性下吞吐量提升15倍。DFlash已发布20个检查点,支持SGLang、vLLM和TensorRT-LLM。AI模型DFlashQwen3-8BNVIDIA Blackwell8 个信源在谈事件专题推荐理由:UC San Diego搞了个新方法DFlash,用扩散模型直接生成整段token,比自回归快几倍,Qwen3-8B上6倍加速,Blackwell上15倍,还开源了检查点,搞推理加速的可以看看。原文稍后读已读值得跟进有用关注 DFlash
01:55官方一手AWS Machine Learning Blog@Andy Peng精选本文介绍如何利用Amazon SageMaker AI中的P-EAGLE方法并行化推测解码,加速生成式AI推理。用户可从SageMaker JumpStart目录中选择兼容模型,并配置并行草稿生成参数。通过部署优化的实时SageMaker AI端点,可显著降低推理延迟。P-EAGLE基于EAGLE框架,支持多头并行推测,适用于Llama等主流模型。技巧P-EAGLEAmazon SageMaker AISageMaker JumpStart推荐理由:AWS教你用P-EAGLE在SageMaker上把推理加速好几倍,选模型调参数就能部署,简单实用。原文稍后读已读值得跟进有用关注 P-EAGLE
11:56官方一手arXiv: DeepSeek@Yingnan Zhao, Razvan Bunescu, Ahmed Louri, Avinash Karanth, Ke Wang针对MoE模型(如Qwen、DeepSeek)推理中专家加载延迟高的问题,研究者分析了专家选择行为,发现相邻MoE层和连续解码token间专家请求存在强相关性。基于此提出ST-MoE,一个结合轻量级运行时预测机制与可重构硬件设计的专家预取框架。ST-MoE通过预取专家与计算重叠,显著提升推理性能并降低能耗,同时保持模型精度。实验在多种MoE模型和应用(语言理解、代码生成)上验证了有效性。论文MoEQwenDeepSeek推荐理由:这篇论文分析了Qwen、DeepSeek等MoE模型的专家加载瓶颈,用ST-MoE框架通过预取专家来加速推理,兼顾效率和精度,适合关注大模型推理优化的读者。原文稍后读已读值得跟进有用关注 MoE
02:16官方账号LMSYS Org (SGLang)@lmsysorg76°LMSYS 发布博客介绍 DFlash 和 Spec V2 推测解码技术。在 8 块 B200 上,针对 HumanEval 基准,DFlash + Spec V2 实现超过 4.3 倍基线吞吐量和 1.5 倍原生 MTP 吞吐量。其核心包括块扩散起草器(一次前向传播生成完整 token 块)和 KV 注入(目标模型特征馈入每层 KV 缓存),以及 Spec V2 重叠调度器带来 33% 端到端提升。该方案现已作为 SGLang 的默认推测解码引擎。AI模型DFlashSpec V2SGLang推荐理由:LMSYS 和 Modal 联手推出了 DFlash,让 Qwen 3.5 的推理速度比原生 MTP 快 1.5 倍,比基线快 4.3 倍,代码已开源,玩起来!原文稍后读已读值得跟进有用关注 DFlash
11:11官方账号arXiv cs.LG@Ali Asaria, Tony Salomone, Deep Gandhi精选论文发现消费级Ampere GPU上扩散Transformer的INT8量化常因反量化回bf16而无法利用INT8张量核心。作者为Ideogram 4.0线性层设计了一个融合Triton INT8 GEMM内核,在Ampere张量核心上执行int8×int8→int32,并在epilogue中折叠逐token×逐通道反量化和偏置。该内核实现2.8-4.2倍于bf16的GEMM加速,并保持余弦相似度1.0且无NaN。端到端测试中,在单张RTX 3090上768px分辨率获得约9-10%提速,1024px生成耗时156.5秒,优于NF4(164.5秒)和FP8(172.9秒)基线,且PickScore/CLIPScore无质量损失。论文Ideogram 4.0RTX 3090INT82 个信源在谈事件专题推荐理由:INT8反超FP8,单卡RTX 3090跑1024px扩散模型原文稍后读已读值得跟进有用关注 Ideogram 4.0
12:31karminski-牙医 (AI工具)@karminski3精选Google发布了Gemma小模型的Diffusion版本,名为Diffusion Gemma,大小26B但激活参数量仅4B。与NVIDIA合作针对RTX 4090和5090优化,5090上每秒可生成700+ token。Diffusion模型像刮奖一样逐片生成文本,速度远快于传统逐字生成模型,但输出质量略低。在AIME 2026数学测试中达到Gemma4-26B-A4B的94%水平,在Agent能力测试中达到82%。4bit量化版本仅需16G显存即可运行。AI模型Diffusion模型GemmaGoogle10 个信源在谈事件专题推荐理由:Diffusion Gemma把文本生成速度拉到单卡700TPS,做实时对话或高吞吐推理的团队可以直接用,4bit量化16G显存就能跑,值得试试能否做投机解码的草稿模型。原文稍后读已读值得跟进有用关注 Diffusion模型
12:10官方账号vLLM@vllm_project精选73°GoogleDeepMind 推出了 DiffusionGemma,这是一个基于 Gemma4 架构的 26B 参数扩散语言模型(dLLM),并成为 vLLM 原生支持的首个扩散语言模型。与传统自回归模型逐个生成 token 不同,DiffusionGemma 能并行去噪 256 个 token 的块,在单张 H200(FP8)上以 batch size 1 实现超过 1200 输出 token/秒的吞吐量。该模型通过 vLLM 的 model runner v2 的 ModelState 和现有推测解码路径实现,对调度器和运行器改动极小。FP8 和 NVFP4 检查点已托管在 RedHat AI 中心,由 GoogleDeepMind、RedHat AI 和 NVIDIA AI 团队合作完成。这一进展标志着扩散模型在高效文本生成领域迈出重要一步。AI模型扩散语言模型vLLMGoogleDeepMind10 个信源在谈事件专题推荐理由:DiffusionGemma 用并行去噪替代逐 token 生成,大幅提升推理速度,做大规模文本生成或实时应用的团队可以直接在 vLLM 中体验,值得关注。原文稍后读已读值得跟进有用关注 扩散语言模型