用 Qwen-Image-2.1 画图的朋友可以试试这个官方 turbo 版,8 步就出图,比默认采样快不少,推理加速可以搭配 vllm-omni。
#推理加速
一篇很巧的论文:让扩散模型在需要细节的地方用细 token、别处用粗 token,预训练模型不用重训就能提速,还能接智能体的规划布局。
Cerebras 的 CEO 亲自讲清楚自家芯片为什么比 GPU 快 2500 倍,关键就在权重存在 SRAM 而不是 HBM,听完就懂。
一个玩家用单张消费卡跑出比多数 API 还快的推理速度,靠的是 Qwen Flash 的模型设计和 Strata 流水线架构,文章讲清了原理,本地部署党别错过。
MiniMax-H3 生成太慢太吃显存?这篇把云端和边缘两端都解决了,最快 30 倍提速,单张 DGX Spark 就能跑视频生成。
一篇体系结构论文,做了个跨主机的总线互连,64 卡系统上把 RoCE 的延迟砍一半,跑 DeepSeek R1 快 30%-80%,做 AI 集群的你看看。
这篇论文提出了ChebBooster,一种基于切比雪夫多项式的训练免费外推框架,能显著提升扩散Transformer的推理效率,值得一看。
腾讯混元开源了AngelSpec,一个能帮你的模型推理提速近2倍的投机解码框架,实测比DFlash还快10%以上,代码和权重都直接可用了。
论文提出DraftExpert,通过训练轻量草稿专家和预取机制,让端侧MoE模型推理速度提升1.45倍,适合关注边缘部署和推理加速的朋友。
Lightelligence 把光计算从论文带到了真实门禁系统里,PACE 3 芯片的 256x256 矩阵能跑低延迟推理,是商用落地的首个案例,值得关注。
Miles 发布了 OPD 方法,让 Qwen3.5 模型推理更快更准,无需任务奖励,比传统蒸馏更高效,适合模型压缩场景。
芯展速用SSD给显卡做显存扩展,首Token快了50倍,8卡RTX 5090集群也能跑128K上下文,适合长文本推理场景。
Hugging Face 和 Google 搞了个挑战赛,100多个 AI agent 和人类一起把 Gemma 4 推理速度在单张 A10G 上提升了5倍,最快冲到491.8 TPS,挺酷的。
谷歌出了个LiteRT.js,用WebAssembly让浏览器跑AI比TensorFlow.js快3倍,尤其在M4 MacBook上效果明显。
vLLM和Hugging Face搞了个大活:Transformers v0.25.0直接兼容vLLM,450多个模型自动加速,不用自己写适配代码了,开箱即用!
NVIDIA 和 d-Matrix 搞了个混合算力方案,GPU 负责预填充、专用芯片负责解码,推理 Token 生成速度翻了 10 倍。不是单纯的拼硬件,是真正分工优化。
长上下文推理内存瓶颈有救了!DepthWeave-KV用跨层分解加自适应压缩,8.3倍KV缓存缩减,速度72.8 tokens/s,比其他方法效果更好。
OpenAI 把 GPT-5.6 Sol 放到 Cerebras 上跑,推理速度飙到 750 tokens/s,比常规部署快很多,适合追求低延迟的场景。
DeepSeek 把 DSpark 开源自带进 vLLM,跑 DeepSeek-V4 实测单卡 250 token/s,比 MTP 快 12-42%,想搞投机解码的可以试试。