8月25日
11:10
11:10官方账号arXiv cs.LG@Chengjie Lu, Tianchi Deng, Zhengqi He, Chengwen Luo, Xueliang Li
ChebBooster通过切比雪夫多项式理论实现训练免费的外推框架,为扩散Transformer(DiTs)提供稳定高效的加速。在DiT-XL/2、PixArt-$Σ$和FLUX.1-dev等三个代表性模型上,ChebBooster在视觉质量和推理效率上均取得显著提升,达到$3.68 imes$延迟速度提升和$5.12 imes$浮点运算减少,优于现有训练免费基线。
推荐理由:这篇论文提出了ChebBooster,一种基于切比雪夫多项式的训练免费外推框架,能显著提升扩散Transformer的推理效率,值得一看。
8月5日
7月29日
7月27日
16:21
16:21官方一手Pandaily@contact@pandaily.com (Pandaily)
Lightelligence 在 WAIC 2026 上展示了全球首个实际部署的光计算系统——天书光立方门禁控制。该公司同步发布 PACE 3 光芯片,其 256x256 光子矩阵用于低延迟推理任务。该芯片已在真实场景中运行,标志光计算从实验室走向商业化。PACE 3 的光子矩阵设计相比传统电子芯片在功耗和延迟上有数量级优势。

推荐理由:Lightelligence 把光计算从论文带到了真实门禁系统里,PACE 3 芯片的 256x256 矩阵能跑低延迟推理,是商用落地的首个案例,值得关注。
7月12日
7月11日
06:22
06:22官方账号Clement Delangue@ClementDelangue
精选
Hugging Face 与 Google Gemma 联合举办的 Gemma Challenge 结果出炉。超过100个 AI agent 和人类在6天内协作,将 Gemma 4 推理速度在单张 NVIDIA A10G GPU 上提升5倍,达到491.8 TPS(最快但有质量损失),无损方案达315 TPS。项目展示了多智能体协作优化模型推理的潜力。
事件专题

推荐理由:Hugging Face 和 Google 搞了个挑战赛,100多个 AI agent 和人类一起把 Gemma 4 推理速度在单张 A10G 上提升了5倍,最快冲到491.8 TPS,挺酷的。
7月8日
16:44
16:35
16:35techcrunch@Anna Heim
ZML是一家由图灵奖得主Yann LeCun背书的法国AI初创公司,近期推出免费产品ZML/LLMD。该软件旨在加速AI推理过程,特别是在大量AI芯片上运行时的效率。通过优化推理速度,ZML/LLMD有望降低AI部署的计算成本。
推荐理由:ZML这波免费发布推理加速软件,能让多芯片推理跑得更快、更省钱,尤其适合做大规模部署的人。
12:19
12:19官方账号arXiv cs.AI@Anna Cordoba, Adam Puente Tercero, Nerea Angulo Hijo, Mar Linares Tercero, Julia Barrientos, Ainhoa Miranda, Jesus Olivera
DepthWeave-KV是一种跨层键值缓存压缩方法,通过共享低秩通道基分解相邻层状态,保留令牌特定残差。它使用令牌条件深度路由器为指令型和检索关键令牌分配更高重构秩,并通过注意力输出探头在线追踪误差自适应压缩。在LongBench等基准上,DepthWeave-KV实现近满缓存任务质量,压缩比达8.3倍,64K上下文速度72.8 tokens/s。
推荐理由:长上下文推理内存瓶颈有救了!DepthWeave-KV用跨层分解加自适应压缩,8.3倍KV缓存缩减,速度72.8 tokens/s,比其他方法效果更好。
7月7日
16:51
16:51@koltregaskes@koltregaskes
73°
OpenAI 宣布其大型模型 GPT-5.6 Sol 将在 Cerebras 硬件上提供推理服务,速度高达 750 tokens 每秒。官方表示该版本与原始模型“相同”,但可能在上下文窗口大小等参数上有调整。该部署预计显著提升推理效率,适用于高吞吐场景。
事件专题

推荐理由:OpenAI 把 GPT-5.6 Sol 放到 Cerebras 上跑,推理速度飙到 750 tokens/s,比常规部署快很多,适合追求低延迟的场景。
11:49
11:49官方一手arXiv: DeepSeek@Xin Cheng, Xingkai Yu, Chenze Shao, Jiashi Li, Yunfan Xiong, Yi Qian, Jiaqi Zhu, Shirong Ma, Xiaokang Zhang, Jiasheng Ye, Qinyu Chen, Chengqi Deng, Jiping Yu, Damai Dai, Zhengyan Zhang, Yixuan Wei, Yixuan Tan, Wenkai Yang, Runxin Xu, Yu Wu, Zhean Xu, Xuanyu Wang, Muyang Chen, Rui Tian, Xiao Bi, Zhewen Hao, Shaoyuan Chen, Huanqi Cao, Wentao Zhang, Anyi Xu, Huishuai Zhang, Dongyan Zhao, Wenfeng Liang
76°
DSpark是一种新型投机解码框架,通过半自回归架构(并行骨干网络+轻量级顺序模块)保持草稿质量,缓解后缀衰减。它采用置信度调度验证,根据前缀存活概率和引擎吞吐量动态调整每轮验证长度。在离线多领域基准测试中,DSpark的接受长度显著优于现有自回归和平行草稿器。在DeepSeek-V4服务系统的真实用户流量下,相比生产基线MTP-1,DSpark在维持吞吐量不变时单用户生成速度提升60%至85%。DSpark还通过防止高并发下吞吐量严重退化,使服务系统达到了此前无法实现的性能层级。
推荐理由:DeepSeek-V4搞了个新框架DSpark,把生成和验证分开调度,用户实际体验加速60%到85%,还不会拖慢系统吞吐。
7月6日
19:51
7月2日
7月1日
10:08
10:08官方账号arXiv cs.AI@Zhaoyang Luo, Runmin Dong, Miao Yang, Fan Wei, Yushan Lai, Bin Luo, Haohuan Fu
论文提出一种操作级视觉令牌跳过框架,将Transformer层分解为注意力与FFN操作,选择性跳过冗余计算。实验覆盖3种MLLM架构(含Qwen3-VL)和10个VQA基准,实现精度-效率权衡:在Qwen3-VL上减少33.7% TFLOPs,保留99.5%的原始性能。关键发现是晚期视觉令牌更新对答案表示影响很小,且有效计算具有操作主导性和层依赖性。
推荐理由:这篇论文告诉你如何在不牺牲性能的前提下大幅降低多模态大模型的计算量。他们在Qwen3-VL上砍了33.7%的算力,性能只掉了0.5%,方法很巧妙。
02:48
02:48Amjad Masad@amasad
精选
AI推理成本高昂的原因之一是多数工作负载运行在预LLM时代的通用硬件上。Etched从隐身模式亮相,其系统专为现代推理从零设计。公司已获得超过10亿美元客户合同和8亿美元融资。早期测试显示,在推理工作负载上吞吐量、延迟和能效均达到SOTA。首批机架将于今年夏季发货。
事件专题

推荐理由:Etched做了专为AI推理优化的芯片,比通用硬件在吞吐、延迟、能效上都做到了目前最好。今年夏天就发货,关注成本的人可以看看。
6月28日
13:11
13:11官方一手pandaily@contact@pandaily.com (Pandaily)
DeepSeek 发布 DSpark 推测解码框架,可将文本生成速度提升 80%。该框架优化推理效率,标志着 AI 竞争焦点从训练规模转向实际部署。DSpark 采用推测解码技术,通过小模型草稿加速大模型生成。

推荐理由:DeepSeek 的 DSpark 框架让模型生成快八成,推理部署更省算力,搞推理优化的可以看看。
6月24日
15:30
15:30官方一手marktechpost@Asif Razzaq
76°
UC San Diego推出DFlash,用轻量级块扩散模型替代自回归起草器,实现投机解码。该方法通过单次前向传播生成整块token,并利用KV注入条件于目标隐藏特征。在Qwen3-8B上达到6.08倍无损加速,NVIDIA报告在Blackwell上固定交互性下吞吐量提升15倍。DFlash已发布20个检查点,支持SGLang、vLLM和TensorRT-LLM。
事件专题

推荐理由:UC San Diego搞了个新方法DFlash,用扩散模型直接生成整段token,比自回归快几倍,Qwen3-8B上6倍加速,Blackwell上15倍,还开源了检查点,搞推理加速的可以看看。
6月16日
6月12日
12:31
12:31karminski-牙医 (AI工具)@karminski3
精选
Google发布了Gemma小模型的Diffusion版本,名为Diffusion Gemma,大小26B但激活参数量仅4B。与NVIDIA合作针对RTX 4090和5090优化,5090上每秒可生成700+ token。Diffusion模型像刮奖一样逐片生成文本,速度远快于传统逐字生成模型,但输出质量略低。在AIME 2026数学测试中达到Gemma4-26B-A4B的94%水平,在Agent能力测试中达到82%。4bit量化版本仅需16G显存即可运行。
事件专题

推荐理由:Diffusion Gemma把文本生成速度拉到单卡700TPS,做实时对话或高吞吐推理的团队可以直接用,4bit量化16G显存就能跑,值得试试能否做投机解码的草稿模型。