21:13官方账号LMSYS Org (SGLang)@lmsysorg71°SGLang团队为DeepEP MoE引入两种调度时负载均衡器Waterfill和LPLB。Waterfill将共享专家工作分配到较轻的rank,在DeepSeek V3/R1上带来+1.48%到+4.66%的性能提升,V4 Flash吞吐量从49,253 tok/s增至51,677 tok/s。LPLB优化冗余路由专家副本的流量分配,在red16/red32配置下取得+0.84%到+7.34%的提升。两种方法均不改变模型语义,保持推理精度。AI产品SGLangDeepEPDeepSeek V3推荐理由:SGLang给DeepSeek模型加了两个新负载均衡器,跑DeepSeek V3/R1速度能快最多7%,而且不改精度,想加速推理的可以试试。原文稍后读已读值得跟进有用关注 SGLang
21:45Thomas Wolf@Thom_Wolf实验让100多个智能体协作一周,优化vLLM中Gemma 4推理速度,最终实现5倍提升。智能体自发拒绝人类社交工程尝试,发现验证漏洞并请求社区裁决。四智能体接力构建int4-lm_head检查点,经诊断配置错误后达到118 TPS(2.68×)。GPU富/贫分工、跨智能体内核调试、配额池化等行为涌现。智能体还指出127 TPS“墙”是假象,并讨论了int4-Marlin floor的循环证明问题。AI模型Gemma 4vLLM多智能体2 个信源在谈事件专题推荐理由:这个实验展示了100多个AI智能体像人类社区一样自发协作、互相监督,甚至发现了验证漏洞。一周将Gemma 4推理速度优化5倍,很酷。原文稍后读已读值得跟进有用关注 Gemma 4
05:27Fireworks AI@FireworksAI_HQ精选Fireworks AI 宣布攻克了在前沿模型上使用强化学习时,保持训练和推理数值完全一致(零KLD)的难题。他们将该解决方案作为托管服务提供,首发支持 GLM 5.2 模型。这项服务确保端到端数值对齐,简化了RL训练流程。AI产品Fireworks AIGLM 5.2强化学习推荐理由:Fireworks AI 把强化学习里最头疼的数值一致性问题搞定了,还能直接托管GLM 5.2,省去自己搭基础设施的麻烦。原文稍后读已读值得跟进有用关注 Fireworks AI
13:13官方账号vLLM@vllm_projectvLLM 项目宣布支持 DFlash 投机解码,用户只需将 EAGLE-3 检查点替换为 DFlash 检查点即可启用,无需修改代码。该功能通过开源 Speculators 库将 DFlash 草案模型与目标模型的隐藏状态连接。在单块 Blackwell Ultra GPU 上运行 Gemma-4 31B 模型,Math500 基准取得 5.8 倍吞吐量提升,GSM8K 提升 5.3 倍,HumanEval 提升 5.6 倍,MBPP 提升 4.4 倍。AI模型DFlashvLLMGemma-410 个信源在谈事件专题推荐理由:vLLM 和 NVIDIA 合作推出 DFlash 投机解码,Gemma-4 31B 推理速度提升近 6 倍,配置只需改一行 checkpoint 路径。原文稍后读已读值得跟进有用关注 DFlash
01:02官方账号LMSYS Org (SGLang)@lmsysorg79°与NVIDIA合作,在GB300上使用SGLang服务DeepSeek-V4,实现5倍吞吐量提升(~2,200→~11,200 tok/s/GPU,交互性~50 tok/s/user)。借助MTP,在80 tok/s/user交互性下吞吐再提升2.6倍。Blackwell Ultra聚合模式下30 tok/s/user时吞吐提升2.91倍,峰值无MTP吞吐提升超6倍。采用W4A4 MegaMoE量化(MXFP4)且精度损失可忽略。单个FP8-einsum修复将MTP接受率从0.57提至0.70。AI模型DeepSeek-V4GB300SGLang8 个信源在谈事件专题推荐理由:想用SGLang在GB300上榨干DeepSeek-V4?NVIDIA合作实测,吞吐翻5倍,交互延迟不变,MTP和量化细节全公开。原文稍后读已读值得跟进有用关注 DeepSeek-V4
03:05官方账号Together AI@togethercompute精选MiniMax-M3 模型支持智能体携带长历史(超过百万token)、图像、视频、文档和工具输出进入上下文,显著提升多模态信息处理能力。Together 的推理优化通过改进服务路径上的 token 吞吐量,使这一能力在大规模部署时更实用。相比之前方案,每 GPU 可处理更多 token,从而降低每美元自动化工作成本。AI模型MiniMax-M3Together智能体2 个信源在谈事件专题推荐理由:MiniMax-M3 让智能体一口气带进长历史、图、视频、文档和工具输出,Together 优化后每 GPU token 翻倍,自动任务成本更低。原文稍后读已读值得跟进有用关注 MiniMax-M3
18:37官方账号Together AI@togethercompute精选Together AI分享了优化GLM 5.1推理性能的三项关键改进。他们重写了索引器的topk内核。接着融合了索引器内核以减少内存和启动开销。同时消除了限制预填充吞吐量的CPU开销。这些优化显著提升了GLM 5.1在Together AI平台上的运行效率。AI模型GLM 5.1Together AI推理优化推荐理由:想知道Together AI怎么让GLM 5.1跑得更快?他们分享了三个工程优化点,对部署GLM 5.1有直接帮助。原文稍后读已读值得跟进有用关注 GLM 5.1
18:34官方账号Together AI@togethercomputeTogether AI 部署的 DeepSeek V4 Pro 在 Artificial Analysis 基准测试中同时获得输出速度和延迟两项第一。该成绩通过优化 KV 缓存、前缀复用、内核及端点配置实现。Together AI 公开了其推理系统的具体工程方案,包括缓存策略和内核调优。AI模型DeepSeek V4 ProTogether AIArtificial Analysis1 个信源在谈事件专题推荐理由:Together AI 把 DeepSeek V4 Pro 调到了速度与延迟双第一,还公开了优化方法,搞推理部署的值得看看。原文稍后读已读值得跟进有用关注 DeepSeek V4 Pro
11:01官方账号arXiv cs.LG@Inesh Chakrabarti, David Limpus, Aditi Ghai Rana, Bowen Bao, Spandan Tiwari, Thiago Crepaldi, Ashish Sirasao论文提出UltraQuant,一种针对智能体工作负载的4位KV缓存压缩方法,基于TurboQuant旋转和码书量化。在长上下文多轮任务中,UltraQuant在缓存压力大的后期轮次将P50首令牌延迟降低3.47倍,全轮次平均降低2.3倍。相比FP8 KV缓存基线,输出吞吐量提升1.63倍。设计包括非对称K/V处理、Walsh-Hadamard旋转及AMD GPU专用优化。论文UltraQuantFP4KV缓存推荐理由:长上下文智能体推理慢?UltraQuant把4位KV缓存做到实用,延迟降3倍多,吞吐涨1.6倍,值得看看。原文稍后读已读值得跟进有用关注 UltraQuant
03:08官方账号vLLM@vllm_project精选72°Anyscale 与 Google Cloud GKE 合作推出 Ray Serve LLM 新版本,在 vLLM 基础上实现显著性能飞跃。预填密集型负载吞吐量提升 4.4 倍,解码密集型负载提升 24 倍。三个关键优化包括:控制平面端点选择器的直接流式传输、新的 vLLM Ray V2 执行器后端、以及基于 HAProxy 的 C 语言级路由。Ray 的容错、可观察性和跨 K8s/VM 可移植性为复杂推理部署奠定基础。AI模型Ray Serve LLMvLLMAnyscale推荐理由:Anyscale 和 Google Cloud 联手让 vLLM 推理快了好几倍,预填负载快 4.4 倍,解码负载快 24 倍,用 Ray V2 执行器就能体验。原文稍后读已读值得跟进有用关注 Ray Serve LLM
11:09IT之家(博客/媒体)72°华为昇腾宣布0 Day支持智谱GLM-5.2,昇腾A3系列已实现单双机及大EP推理部署。优化技术包括MOE大融合算子、通信与计算融合、注意力前处理与多Token预测、高并发调度与预填充延迟机制等。GLM-5.2在Code Arena盲测中取得全球可用模型第一,拥有1M上下文能力,长程任务表现介于Claude Opus 4.7与4.8之间。该模型在主流编程基准上保持开源SOTA,并已适配华为昇腾等国产算力平台。AI模型GLM-5.2华为昇腾推理优化推荐理由:华为昇腾0 Day适配智谱GLM-5.2,推理优化让长上下文编程更高效,开源模型性能比肩Claude Opus。原文稍后读已读值得跟进有用关注 GLM-5.2
05:03官方一手AWS Machine Learning Blog@Dan FergusonAWS 宣布 Amazon SageMaker AI 异步推理(Async Inference)现支持在 InvokeEndpointAsync API 的请求体中直接发送推理负载(inline payload),无需预先上传至 S3。这一功能简化了工作流,减少了与 S3 的交互步骤,并降低了延迟。用户可在请求正文中放入不超过 2MB 的数据,适用于轻量级推理场景。AI产品SageMaker异步推理inline payload1 个信源在谈事件专题推荐理由:AWS SageMaker 异步推理现在可以直接在请求里传数据,不用先传 S3 了,省一步操作。原文稍后读已读值得跟进有用关注 SageMaker
04:27官方账号LMSYS Org (SGLang)@lmsysorg精选73°LMSYS 发表博客详解如何用 SGLang-JAX 在 TPU v7x 上优化 Ling-2.6-1T(1T 参数混合 MoE 模型)。通过 Fused MoE V2 内核将令牌和累加器留在 VMEM 中并双缓冲专家权重,MoE 预填充延迟降低 53%。混合内存池为 10 个全注意力层分配逐令牌 MLA KV,为 70 个 GLA 层分配逐请求循环状态。GLA 线性注意力采用分块并行预填充,单控制器 DP 保持分组 RMS Norm 芯片本地化,无需逐层跨芯片规约。AI模型Ling-2.6-1TTPUSGLang-JAX推荐理由:LMSYS 和 InclusionAI 联手,用 SGLang-JAX 让 1T 参数 MoE 在 TPU 上跑得快 53%,技术细节都在博客里。原文稍后读已读值得跟进有用关注 Ling-2.6-1T
04:25官方一手AWS Machine Learning Blog@Mona MonaAmazon SageMaker AI 发布容器镜像缓存功能,针对推理场景优化扩展速度。该功能在模型扩缩容时可将端到端延迟最高提升2倍。它专为生成式AI模型设计,减少冷启动时间。现已可在AWS区域使用。AI产品SageMaker AI容器缓存模型扩展推荐理由:AWS给SageMaker AI加了容器缓存,扩展时延迟直接减半,适合需要快速响应的生成式AI部署。原文稍后读已读值得跟进有用关注 SageMaker AI
20:16官方账号vLLM@vllm_project精选Anyscale团队发布报告,介绍如何用Ray Serve和vLLM实现PD Disaggregation。该技术在AMD MI325X GPU上通过了压力测试,验证了实际性能提升。报告强调正确配置是发挥优势的关键。技巧vLLMRay ServeAnyscale推荐理由:vLLM推荐了Anyscale的这篇实战文章,讲清楚了PD Disagg在Ray Serve加vLLM上的做法,还在AMD MI325X上测过,值得搞推理部署的人看看。原文稍后读已读值得跟进有用关注 vLLM
13:28官方账号Together AI@togethercompute精选Dan Fu在斯坦福CS336课程中讲解了推理时的KV缓存、prefill/decode分离技术,以及大规模推理的架构。他介绍了Megakernels,通过融合GPU操作实现接近光速的LLM解码。还讨论了Parcae,解释了循环Transformer的扩展问题及其修复方法,并提出了新的缩放定律,暗示现有方法可能未充分利用智能潜力。论文KV缓存MegakernelsParcae推荐理由:Dan Fu讲KV缓存和Parcae新缩放定律原文稍后读已读值得跟进有用关注 KV缓存
12:10官方账号vLLM@vllm_project精选Inferoa 是一个由 @agenticin 构建的社区智能体框架,基于 vLLM 技术栈。它通过推理经济学来塑造智能体循环,包括前缀缓存管理、上下文优化以及在自托管模型和前沿模型之间的路由。该框架旨在帮助开发者更高效地运行智能体,降低推理成本。vLLM 项目团队对此表示期待,并希望开发者能进一步扩展其功能。AI产品智能体vLLM推理优化推荐理由:Inferoa 把推理成本优化直接嵌入智能体循环,做智能体应用或自托管模型的开发者值得关注,能帮你省下不少推理开销。原文稍后读已读值得跟进有用关注 智能体
09:06官方账号arXiv cs.AI@Luoyuan Zhang这篇论文指出当前 AI 智能体在处理相同文档时,每个智能体都会重复执行最耗计算的前缀填充(prefill)步骤,重建相同的键值(KV)缓存,造成巨大浪费。作者提出一个简单方案:让发布者预计算文档的 KV 缓存,其他智能体付费加载后跳过 prefill。实验表明,在 Qwen3-4B 模型上,复用比从头 prefill 节省 9-50 倍计算量,且输出 token 完全一致。但 KV 缓存体积大、难以压缩,直接传输成本高;作者建议在服务端托管(类似 prompt-caching),消除传输开销。以一个热门 3774 token 文档被 80M 智能体访问为例,复用计算成本仅约 3 万美元,而重新 prefill 需 150 万美元,节省 49.7 倍。论文还提出了智能体原生 prefill CDN 的框架,并指出无损 KV 压缩和跨方支付层是待解决的关键问题。论文KV缓存推理优化智能体推荐理由:这篇论文直击 AI 智能体重复计算同一文档的浪费痛点,做 LLM 推理优化或智能体基础设施的团队值得关注——它提出的 KV 缓存共享方案可能大幅降低推理成本,且已有实测数据支撑。原文稍后读已读值得跟进有用关注 KV缓存
11:30官方账号arXiv cs.AI@Cheng-Yu Yang, Shao-Yuan Lo, Yu-Lun Liu精选视觉语言模型(VLM)将图像投影为数百到数千个视觉令牌,导致解码器推理成本高昂。现有方法通常采用“排序并移除”范式,永久丢弃低分令牌。但研究发现,视觉令牌的重要性会随解码器深度变化,早期低分令牌可能在后续层变得重要。为此,研究者提出Reroute,一种无需训练的插件,将移除改为可恢复路由:被延迟的令牌在后续阶段重新进入候选池。该方法在FastV、PDrop等方案上,在LLaVA-1.5和Qwen骨干上,在激进令牌缩减下提升了接地性能,同时保持VQA性能。这表明VLM令牌缩减应视为可恢复路由,而非不可逆修剪。代码已开源。论文视觉语言模型令牌缩减可恢复路由推荐理由:VLM推理成本高是实际部署的痛点,Reroute用零训练代价解决了令牌缩减中信息丢失的问题,做多模态模型优化或部署的团队可以直接集成到现有方案中,值得一试。原文稍后读已读值得跟进有用关注 视觉语言模型
09:08官方一手arXiv: DeepSeek@Wenxin Wang, Yule Hou, Yu Ji, Peng Qu, Youhui Zhang精选72°本地部署大型混合专家模型(MoE)在服务质量上远不及云端环境,即使低并发场景也存在四大差距:依赖降级模型、无法满足长预填充的30秒TTFT、解码吞吐量低于20 tokens/s、混合负载下并发能力差。本文提出CPU-GPU混合系统,通过流式加载预填充(SLP)将预填充吞吐提升至1200 tokens/s,支持32K提示词在30秒内完成;分布式SLP(DSLP)结合SmallEP专家并行,在双RTX 5090上达到1800 tokens/s和45K提示词;以及零拷贝共享权重的节点内预填充-解码分离、AVX-512优化的FP8 GEMV内核等技术。该系统在消费级CPU-GPU平台上实现了旗舰MoE模型的云级服务质量,无需数据中心基础设施即可获得高质量、低成本的本地推理。论文MoE模型CPU-GPU混合推理优化推荐理由:本地跑MoE大模型终于能追上云端的服务质量了——做本地部署的开发者可以直接参考这套CPU-GPU混合方案,不用再忍受降级模型和低吞吐。原文稍后读已读值得跟进有用关注 MoE模型
20:29rohanpaul_ai@rohanpaul_ai一篇新论文发现 Transformer 的 Key 和 Value 投影可以共享同一映射,从而将 KV 缓存减少 50%,而困惑度仅上升 3.1%。最佳变体 Q-K=V 保留了 Query 的独立性,使注意力仍具有方向性。结合 GQA 和 MQA 时,缓存削减可达 87.5% 和 96.9%。弱变体 Q=K-V 因对称性不适合因果语言模型,且无缓存节省。该发现挑战了传统 QKV 三投影的必要性,对推理内存优化有重要意义。论文TransformerKV 缓存注意力机制推荐理由:做 LLM 推理优化的团队可以直接参考这个设计——砍掉一半 KV 缓存但几乎不损质量,值得在自家模型上试试。原文稍后读已读值得跟进有用关注 Transformer
10:59官方账号arXiv cs.AI@Hetvi Shastri, Pragya Sharma, Walid A. Hanafy, David Irwin, Mani Srivastava, Prashant Shenoy精选现有大模型服务系统将每个定制任务部署为独立模型实例,导致骨干模型重复部署、加速器内存浪费,且无法分摊批处理和加载成本。FMplex 提出一种新范式,将大模型骨干视为虚拟化基础,为每个任务提供逻辑上私有的虚拟大模型(vFM),实际共享同一物理骨干。该方案支持任务独立扩展、生命周期和隔离性,并设计了批感知公平队列调度器,实现任务间和任务内的批处理。在 7 个骨干模型(16 个变体)和 92 个下游任务上,FMplex 相比空间分区降低延迟 80%,相比尽力共置降低 33.3%,集群规模下可承载多达 6 倍的任务数。论文模型服务虚拟化批处理调度推荐理由:做模型服务系统或推理优化的团队,FMplex 的虚拟化思路能直接帮你省显存、降延迟,建议研究其调度和共享机制。原文稍后读已读值得跟进有用关注 模型服务
00:42OpenRouter@OpenRouterAI精选OpenRouter 指出,在决策点切换模型能有效减少自偏好偏差,即模型倾向于固守自身失败的推理轨迹。该观点引用 Panickssery 等人 2024 年的论文,强调切换模型可打破这种锚定效应,提升决策质量。这对于需要多模型协作或复杂推理的 AI 应用场景具有重要参考价值。AI模型OpenRouter自偏好偏差模型切换推荐理由:做多模型编排或推理链优化的开发者,这个发现能帮你减少模型自我锚定带来的错误,值得在 pipeline 里试试切换策略。原文稍后读已读值得跟进有用关注 OpenRouter
09:43官方一手Pandaily@contact@pandaily.com (Pandaily)精选StepFun 最新模型 Step 3.7 Flash 在 Artificial Analysis 基准测试中夺得速度、成本效率和端到端性能三项第一。该模型在 OpenRouter 和 Hugging Face 上获得大量关注,展现出强大的竞争力。这一成绩表明 StepFun 在推理优化和成本控制方面取得了显著突破,为开发者提供了高性价比的 AI 模型选择。AI模型Step 3.7 Flash基准测试推理优化推荐理由:做 AI 应用选型或部署推理服务的团队,Step 3.7 Flash 在速度和成本上的优势值得直接对比测试,可能帮你省下不少预算。原文稍后读已读值得跟进有用关注 Step 3.7 Flash
04:40官方账号Together AI@togethercompute76°MiniMax-M3 是一款结合了 1M 上下文窗口、原生多模态能力和 MiniMax 稀疏注意力机制的新模型。Together 的推理和内核团队通过 KV-block-major 稀疏注意力、分页 MSA 解码、优化索引评分以及 GPU 工作前的多模态预处理,将常见智能体流量下的吞吐量提升了 81-125%。该模型在长上下文和多模态任务上表现出色,适合需要处理大量信息和多种数据类型的应用场景。AI模型MiniMax-M3稀疏注意力多模态7 个信源在谈事件专题推荐理由:做长上下文和多模态应用的团队可以关注——MiniMax-M3 的稀疏注意力优化让吞吐量提升显著,直接降低推理成本,值得一试。原文稍后读已读值得跟进有用关注 MiniMax-M3
01:52官方账号NVIDIA AI@NVIDIAAI精选DynoSim 是 NVIDIA 推出的工作负载驱动模拟工具,用于优化 Dynamo 推理服务栈的部署。它将 exhaustive 的部署搜索转化为 simulate-then-verify 循环,可在虚拟时间线上建模整个栈。团队能通过高保真模拟快速筛选数千种配置,然后仅在真实硬件上验证最佳候选。测试显示其模拟速度比真实时间快 1500 倍。技巧NVIDIADynoSimDynamo3 个信源在谈事件专题推荐理由:NVIDIA 搞了个模拟器,部署配置筛选快千倍原文稍后读已读值得跟进有用关注 NVIDIA
00:16berryxia@berryxia精选72°小米MiMo模型近期大幅降价,背后是团队对推理系统的彻底重构。他们采用Hybrid Sliding Window Attention架构,将KVCache存储压缩至全注意力的约1/7。团队针对SWA缓存难题重新设计了KVCache管理、层级缓存和prefix-cache tree,并优化了调度策略与Prefill/Decode流水线。在真实生产流量下,有效KVCache容量提升近5倍,缓存命中率稳定在93%-95%。结合MoE配置调优和多模态推理优化,最终实现了长上下文推理成本的降低,支撑了此次降价。AI产品小米MiMo推理优化推荐理由:做模型推理优化的团队值得看看——小米MiMo团队用Hybrid SWA和系统级优化把成本打下来,证明了架构落地比参数更重要,建议点开了解具体实现。原文稍后读已读值得跟进有用关注 小米
08:06Julien Chaumond@julien_cNVIDIA 发布了 DeepSeek-V4-Pro-NVFP4 的修复版本,该模型基于 DeepSeek-V4 架构,采用 NVFP4 精度优化,旨在提升推理效率和性能。修复版解决了之前版本中的一些问题,使模型更加稳定可靠。对于使用 NVIDIA 硬件进行 AI 推理的开发者来说,这是一个值得关注的更新。AI模型DeepSeek-V4NVIDIANVFP45 个信源在谈事件专题推荐理由:NVIDIA 官方修复版解决了 DeepSeek-V4 在自家硬件上的精度和稳定性问题,用 NVIDIA GPU 做推理的团队可以直接拉取使用,省去自己调优的麻烦。原文稍后读已读值得跟进有用关注 DeepSeek-V4
04:17官方账号Together AI@togethercompute72°Together AI 推出了目前最快的两个语音转文字(STT)模型,其中 NVIDIA Parakeet-TDT 0.6B v3 能在 10 秒内转录 20 小时的语音。该模型基于 TensorRT 优化、条件 CUDA 图、事件驱动 I/O 和共享内存等技术实现极致性能。这一进展大幅降低了大规模语音转录的延迟和成本,对需要实时或批量处理语音的团队意义重大。Together AI 通过系统级优化展示了 STT 模型在推理速度上的新标杆。AI产品语音转文字NVIDIA Parakeet-TDTTogether AI5 个信源在谈事件专题推荐理由:语音转录速度提升了一个数量级,做实时语音应用或大规模音频处理的团队可以直接用上,省下不少时间和算力成本。原文稍后读已读值得跟进有用关注 语音转文字
01:29rohanpaul_ai@rohanpaul_ai83°Kog AI 在 8× AMD MI300X GPU 上实现了 3000 tokens/s 的推理速度,在 8× NVIDIA H200 上达到 2100 tokens/s(FP16,无投机解码)。这一速度比常规低批次解码快 10-30 倍。其核心创新是将 LLM 解码视为内存流问题而非数学问题,通过 monokernel 技术将整个解码过程作为单个持久 GPU 程序运行,消除了内核启动、CPU 调度和中间内存往返的开销。他们还优化了同步机制和内存访问,并设计了 Laneformer 模型使用延迟张量并行技术。目前技术预览基于 2B 模型,但声称可扩展到大型 MoE 模型。AI模型推理优化GPUKog AI5 个信源在谈事件专题推荐理由:Kog AI 把 GPU 推理的隐藏效率瓶颈挖出来了,做 LLM 推理优化的开发者可以直接关注他们的技术预览,看看 monokernel 和延迟张量并行能否复现到自己的模型上。原文稍后读已读值得跟进有用关注 推理优化
22:06官方账号LangChain@LangChainAILangChain 发布 Deep Agents v0.6,将 Harness Profiles 提升为一等抽象,使得开发者可以轻松配置和优化模型推理。新版本支持 Kimi、Qwen、DeepSeek 等开源模型,在保持生产级性能的同时,成本仅为闭源前沿 API 的 1/20 以下。这为需要高性价比 AI 代理的团队提供了更灵活的选择。AI产品LangChainDeep AgentsHarness Profiles推荐理由:做 AI 代理的团队终于可以低成本使用开源模型达到生产级性能,建议做推理优化的开发者直接试试 Harness Profiles 的调优功能。原文稍后读已读值得跟进有用关注 LangChain
07:20rohanpaul_ai@rohanpaul_ai76°Kog@AI 在 8×AMD MI300X GPU 上实现了 3000 tokens/s 的推理速度,8×NVIDIA H200 上为 2100 tokens/s(FP16,无推测解码),远超高端 GPU 通常的 100-300 tokens/s。他们将 LLM 解码视为内存流问题,通过将整个 token 生成循环保留在单个持久 GPU 程序中,消除了内核启动、CPU 调度和中间内存写入的开销。同时,通过让每个计算单元只等待所需数据,并针对 MI300X 的芯片拓扑优化内存访问,减少了同步浪费。模型架构延迟了张量并行通信,使 all-reduce 在后台进行而不阻塞每一层,这要求运行时、GPU 代码和模型设计协同优化。这一突破展示了通过软硬件协同设计大幅提升推理效率的潜力。AI模型推理优化AMD MI300XNVIDIA H2007 个信源在谈事件专题推荐理由:Kog@AI 把推理速度从 300 拉到 3000 tokens/s,做模型部署和推理优化的团队值得研究他们的内存流方法,直接看原文能学到如何消除 GPU 瓶颈。原文稍后读已读值得跟进有用关注 推理优化
12:00官方账号arXiv cs.LG@Zelin Li, Caiwen Ding精选72°研究发现,大语言模型的零阶(ZO)微调本质上是推理密集型负载,而非传统训练。现有实现将ZO算法运行在训练循环中,导致工作负载与运行时的不匹配。研究者通过将ZO微调的重复评分阶段部署在推理运行时(如vLLM)上,在OPT-13B模型上实现了8.13倍加速,且精度几乎无损。该方法在多个模型规模下获得2.34-7.72倍加速,并支持MeZO风格的高秩分解实验。这项工作为将轻量级适配作为推理类负载调度提供了实用路径。论文零阶优化微调推理优化推荐理由:做LLM微调优化的团队终于可以省下GPU时间了——把ZO微调当推理跑,vLLM直接提速8倍,建议做低成本微调的人点开看看实现细节。原文稍后读已读值得跟进有用关注 零阶优化
11:54官方一手arXiv: DeepSeek@Hanjiang Wu, Abhimanyu Rajeshkumar Bambhaniya, Sarbartha Banerjee, Tuhin Khare, Sudarshan Srinivasan, Suvinay Subramanian, Souvik Kundu, Madhu Kumar, Midhilesh Elavazhagan, William Won, Amir Yazdanbakhsh, Tushar Krishna这篇论文系统研究了混合专家(MoE)大模型推理中的多级解耦策略,从分块预填充聚合、预填充-解码解耦到最新的算子级 Attention-FFN 解耦(AFD)。AFD 将注意力计算和 MoE-FFN 执行分别部署在不同 GPU 组上,以应对 MoE 模型中内存受限的注意力、计算密集的专家 FFN 以及 MoE 路由通信带来的异构资源需求。通过结合设备级内核测量和高保真网络模拟的框架,论文在真实工作负载下评估了各级解耦的收益与局限。结果表明,在严格的 TTFT/TPOT 服务等级目标下,AFD 在 DeepSeek-V3.2 上可维持约 4000 tokens/s 的系统吞吐量,而传统非 AFD 部署无法满足要求。论文还给出了根据工作负载和模型架构划分注意力与 FFN 的实用建议,为当前机架/集群级部署及未来解耦 AI 基础设施提供了设计原则。论文MoE推理优化解耦架构推荐理由:MoE 模型推理的瓶颈终于被系统性地拆解了——Attention-FFN 解耦让吞吐量提升到传统方案无法企及的水平,做大规模 MoE 推理部署的团队可以直接参考论文中的分区策略来优化集群。原文稍后读已读值得跟进有用关注 MoE
10:33IT之家(博客/媒体)83°小米 MiMo 官方宣布 MiMo-V2.5 系列 API 永久降价,最高降幅达 99%,且不再区分上下文窗口长度。小米 MiMo 负责人罗福莉在 X 平台发文解释,降价主要得益于推理框架对 SWA 的分层 KV 缓存优化,将缓存 Token 容量提升 5 倍,降低 80% 缓存成本。此外,模型架构的 1:7 Full:SWA 稀疏比使原始推理成本远低于行业平均水平,留有 2 到 3 倍利润空间。降价后,生产推理引擎接近满负载运行,仍能维持收支平衡。罗福莉认为,合理定价的 API 将驱动真实推理需求,拉动 AI 基础设施链发展,形成良性循环。AI产品MiMoAPI降价推理优化推荐理由:小米 MiMo 用架构和推理优化把 API 价格打下来,做 AI 应用开发的团队可以直接用更低成本调用高性能模型,建议关注后续技术博客。原文稍后读已读值得跟进有用关注 MiMo
03:05官方账号阿里通义 Qwen@Alibaba_Qwen76°阿里 Qwen 团队联合多家合作伙伴,在 TokenSpeed 推理引擎上对 Qwen3.5 模型进行极致优化,实现了 580 tokens/秒的推理速度,创下智能体工作负载的新纪录。该成果得益于 NVIDIA GPU、FlashAttention-4 优化以及 PyTorch 社区的支持。这一里程碑展示了开源大模型在推理性能上的巨大潜力,尤其适合对延迟敏感的智能体应用场景。PyTorch 官方博客已发布完整技术细节。AI模型Qwen3.5推理优化TokenSpeed推荐理由:580 tps 意味着智能体应用可以几乎实时响应,做 LLM 推理优化或 Agent 开发的团队值得关注这个开源方案,可以直接参考 PyTorch 博客里的实现细节。原文稍后读已读值得跟进有用关注 Qwen3.5
02:41Aravind Srinivas@AravSrinivas72°Perplexity 开源了其生产环境中使用的 Unigram 分词器,相比 HuggingFace 和 SentencePiece 效率更高。该分词器将 CPU 利用率降低了 5-6 倍,解决了 GPU 上运行的小型重排序器和嵌入器因 CPU 分词延迟而成为瓶颈的问题。项目已在 GitHub 上开源,旨在优化推理管道的端到端延迟。AI产品分词器开源/仓库Perplexity推荐理由:Perplexity 把生产级分词器开源了,CPU 利用率降 5-6 倍,做推理优化的团队可以直接拿来用,减少延迟瓶颈。原文稍后读已读值得跟进有用关注 分词器
00:16xiaomimimo@xiaomimimo小米宣布MiMo-V2.5系列API永久降价,最高降幅达99%,并统一所有上下文长度的定价。MiMo Token计划升级,同等价格下可用Token数量增加5-8倍,计费规则更简单透明。现有用户的Token计划积分将全部重置。MiMo-V2.5-TTS语音合成API限时免费。这些改进得益于MiMo堆栈的推理优化和服务效率提升。AI产品API降价推理优化MiMo推荐理由:API价格直降99%并统一定价,做AI应用开发的团队成本压力骤减,建议立即查看新定价。原文稍后读已读值得跟进有用关注 API降价
12:13官方一手arXiv: DeepSeek@Xiongwei Zhu, Xiaojian Liao, Tianyang Jiang, Yusen Zhang, Liang Wang, Limin Xiao精选细粒度混合专家(MoE)模型在推理时只激活部分专家,但内存受限场景下只能缓存少量专家,未缓存的专家需从慢速外部存储获取,导致频繁换入换出和I/O开销。ReMoE提出一种路由器微调框架,通过偏向近期选中的专家来产生时间上稳定的路由,从而提升专家复用率,减少存储访问。实验表明,在DeepSeek和Qwen模型上,ReMoE将专家复用率提升26%,同时保持下游任务性能。在vLLM GPU-CPU专家卸载场景下,输出吞吐量提升8.4%;在Jetson Orin NX上使用llama.cpp时,TPOT降低43.6-49.8%,解码速度提升1.77-1.99倍。代码和模型已开源。论文MoE模型推理优化路由器微调推荐理由:ReMoE解决了内存受限设备上MoE模型推理的I/O瓶颈,做边缘部署或大模型推理优化的开发者可以直接试,开源代码让复现门槛很低。原文稍后读已读值得跟进有用关注 MoE模型
11:31Geek@geekbbDeepSeek 在 X 平台发文感谢小米 MiMo,宣布 MiMo-V2.5 系列 API 价格永久降低,最高降幅达 99%,并统一了所有上下文长度的定价。同时,MiMo Token 计划升级,同等价格下可用 token 数量增加 5-8 倍,计费规则更简单透明。现有用户的 Token Plan 积分将全部重置,MiMo-V2.5-TTS 在限定时间内免费。这些改进得益于 MiMo 堆栈的推理优化和服务效率提升,相关技术博客后续发布。AI产品DeepSeek小米 MiMoAPI 降价推荐理由:API 价格直降 99% 对开发者是实打实的成本利好,做 AI 应用集成或语音合成的团队可以直接切换,省下预算做更多实验。原文稍后读已读值得跟进有用关注 DeepSeek