17:08官方一手pandaily@contact@pandaily.com (Pandaily)精选北京大学、StepFun与北京邮电大学提出TensorCast,一种面向大模型基础设施的统一可编程张量生命周期管理抽象。在高并发多轮智能体场景中,TensorCast将中位首Token延迟最高降低93.2%。模型实例启动速度最高提升228.6倍。该方案由三所机构联合提出。论文TensorCastStepFun北京大学推荐理由:北大和StepFun搞了个TensorCast,把大模型首Token延迟砍掉九成多,高并发多轮对话场景下很猛。原文稍后读已读值得跟进有用关注 TensorCast
06:50官方账号Pika Labs@pika_labs精选Pika推出音频模型系列,涵盖Soundtrack、Music、SFX和Speech四种生成式声音模型,覆盖声音创作全谱系。官方称其推理技术使这些模型比市场上其他音频模型便宜最多20倍。Pika已在官网博客发布技术详解,介绍高效推理方法如何实现规模化下的音频质量。AI模型Pika音频生成Soundtrack推荐理由:Pika这次把音频模型价格打到市面最低,四款模型覆盖配乐、音乐、音效和语音,做内容的朋友可以留意下。原文稍后读已读值得跟进有用关注 Pika
02:01官方账号阿里通义 Qwen@Alibaba_QwenLightSeek的推理引擎TokenSpeed已支持Qwen3.8(2.4T参数)的大规模多节点部署。作为Day-0开源推理引擎伙伴,LightSeek针对NVIDIA Blackwell做了跨节点DP/EP扩展优化。相比TP16,TokenSpeed的吞吐性能提升超过30%。DSpark投机解码和单CUDA图优化进一步降低了延迟。AI产品Qwen3.8TokenSpeedLightSeek3 个信源在谈事件专题推荐理由:LightSeek的TokenSpeed今天支持Qwen3.8了,多节点下比TP16快三成多,跑2.4T大模型延迟更低。原文稍后读已读值得跟进有用关注 Qwen3.8
22:54techcrunch@Anna Heim法国初创公司Kog认为,GPU不适合智能体工作流的观点可能是个误解。Kog正在更深入地优化GPU推理,以从现有硬件中榨取更多性能。与主流方向不同,Kog选择在GPU上挖掘潜力,而非转向专用硬件。这种做法或可为智能体应用提供更高效的推理基础。AI模型KogGPU推理优化推荐理由:Kog这家法国创业公司说,都说GPU跑智能体任务不行,其实是个误会,他们正深挖推理性能,跟主流唱反调。原文稍后读已读值得跟进有用关注 Kog
22:04官方一手AWS Machine Learning Blog@Qingyuan Tang精选AWS博客介绍了一种在Amazon SageMaker HyperPod上使用Curvine构建分层KV缓存的方法。该方法将KV缓存扩展到共享分布式NVMe池中,使副本能以接近本地磁盘的速度复用缓存。这解决了大规模LLM推理中GPU实例过大或首token延迟高的问题。通过使用成本更高效的实例,该方法在保持性能的同时降低了推理成本。技巧SageMaker HyperPodCurvineKV缓存推荐理由:AWS官方教你用Curvine在HyperPod上搞分层KV缓存,省GPU内存还能提速,跑大模型推理的可以看看。原文稍后读已读值得跟进有用关注 SageMaker HyperPod
18:21官方账号arXiv cs.LG@Zetao Hong, Song Yuan, Yuanhao Ding, Yibo Zhu, Daxin Jiang, Zhibin Wang, Chen TianMISA-T是一种针对混合强化学习rollout服务的路由层准入策略,解决RLVR、RLHF和智能体rollout共享推理服务时的KV缓存竞争问题。在Step3.7和Qwen3.6-35B-A3B上的消融实验中,MISA-T相比调优的vLLM Router将rollout吞吐分别提升53.3%和43.6%,同时保持高前缀缓存命中率。在50次迭代的Step3.7实验中,吞吐提升35.6%,平均迭代时间减少22.8%,且任务分数相当。论文MISA-TRLHFKV缓存推荐理由:做LLM后训练的朋友可以看看,MISA-T把混合rollout调度做得更精细,吞吐提升明显,而且不牺牲任务效果。原文稍后读已读值得跟进有用关注 MISA-T
10:49官方一手arXiv: DeepSeek@Matteo Grella精选PTQTP将LLM权重矩阵分解为两个三元平面,本研究首次将尺度比固定为3的约束引入其求解器,使分解坍缩为统一九级量化器。两个三元平面无损折叠为4位码平面,作为持久服务表示,磁盘字节、专家缓存和内核输入均为4.0625位/权重块。该方法应用于DeepSeek-V4-Flash-0731的284B-A13B MoE模型,在64GB笔记本上从MXFP4权重一次性量化并流式加载专家。与4.5位Q4_K基线相比,在5/5测试中匹配官方API(Q4_K为4/5),MMLU子集得分86对84,解码速度快6.7%,文件小9%。尽管权重重建误差和困惑度更高,但参考保真度无显著差异。论文PTQTPDeepSeek-V4MoE推荐理由:这篇论文把PTQTP量化器约束成九级格式,在DeepSeek-V4上做到和官方API几乎一样准,还快6.7%、文件小9%,适合搞MoE推理优化的朋友看。原文稍后读已读值得跟进有用关注 PTQTP
06:38Latent.Space@latentspacepod精选在latent.space的推理工程大师课中,Baseten的Philip Kiely与@waterloo_intern讲解了模型训练后如何变成快速可靠的产品。他们指出量化误差可以相互抵消,从而解锁更高吞吐量。推理团队目前仍能挖掘20%–200%的性能增益。视频生成面临二次注意力扩展的瓶颈。GLM-5.2还使用自身重写并优化了服务自己的GPU内核。技巧GLM-5.2Baseten推理优化推荐理由:Baseten工程师讲推理优化,量化误差能抵消,GLM-5.2自己优化自己,还有20-200%提速空间。原文稍后读已读值得跟进有用关注 GLM-5.2
04:59官方账号NVIDIA AI@NVIDIAAI精选NVIDIA在AI Model Co-Design系列中发文指出,长上下文模型的推理速度在训练前就已被架构选择决定。随着上下文窗口扩大,注意力机制在推理成本中的占比快速上升,逐渐成为主要负担。文章梳理了4个决定性能上限的架构参数:group size、head dimension、KV-cache size和并行策略。这些选择同时影响系统吞吐量和单个用户的响应速度。技巧NVIDIA长上下文KV-Cache1 个信源在谈事件专题推荐理由:NVIDIA这篇博文把长上下文模型变慢的根源讲透了,训练前选对4个架构参数,服务成本能差很多。原文稍后读已读值得跟进有用关注 NVIDIA
14:08IT之家(博客/媒体)83°OpenAI 于7月29日部署 GPT-5.6 Sol 模型优化 GPT-5.6 系列推理链路。该模型通过 Codex 分析生产流量并学习 Triton 和 Gluon 语言,自主改写 GPU 内核,使端到端服务成本降低最多20%。此外,优化推测性解码后,token 生成效率提升超过15%。OpenAI 还使用开源工具 FpSan 验证内核正确性。AI模型GPT-5.6 SolOpenAI推理优化10 个信源在谈事件专题推荐理由:OpenAI 让自家模型 GPT-5.6 Sol 反过来优化自己的推理,成本降了20%,token 生成快了15%,挺有意思的。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
06:26官方账号Greg Brockman@gdb78°OpenAI 发布了 GPT-5.6 Sol,专门用于提升生产环境的服务效率。部署后,该模型通过自我优化机制进一步降低运行成本。具体改进包括:GPU 内核优化使服务成本降低 20%;推测解码算法改进使 token 生成效率提升超过 15%。AI模型GPT-5.6 SolOpenAI推理优化10 个信源在谈事件专题推荐理由:OpenAI 搞了个新模型 GPT-5.6 Sol,能自己优化自己,部署后服务成本直接降了20%,生成速度还快了15%,搞推理服务的值得关注。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
02:33Fireworks AI@FireworksAI_HQ精选76°Fireworks AI 和 MiniMax 联合公开了 MiniMax Sparse Attention(MSA)内核的代码仓库。Fireworks 优化了注意力内核的加载与存储流水线,实现了 1.6 倍吞吐量提升。两个内核仓库已分别在 GitHub 上开源(fw-ai/minimax-… 和 MiniMax-AI/MSA…)。这项工作旨在推动开源实现的实际价值。AI模型Fireworks AIMiniMaxMSA推荐理由:Fireworks 和 MiniMax 把稀疏注意力内核开源了,实测吞吐快了1.6倍,搞推理优化的不可错过。原文稍后读已读值得跟进有用关注 Fireworks AI
12:00官方一手arXiv: DeepSeek@En-Ming Huang, An-Cheng Chang, Bai-Cheng Jeng, Shih-Hao Hung, H. T. Kung混合专家(MoE)推理中专家GEMM的形状随运行时路由分布变化,现有系统使用静态令牌数桶选择融合内核,忽略每专家路由分布。论文提出分布感知框架,结合Effective Experts指标与Dirichlet逆向建模生成可控路由分布,并开发DA-MoE运行时系统,可在GPU上根据路由直方图与离线调优分布匹配选择近最优融合内核,无需CPU-GPU同步。在HumanEval-X服务轨迹上,DA-MoE在DeepSeek-V3和Kimi K2上将几何平均融合MoE延迟分别提升1.16倍和1.29倍,峰值加速达1.40倍和1.56倍。论文DA-MoEDeepSeek-V3Kimi K2推荐理由:论文提出了DA-MoE,根据路由分布动态选最优内核,在DeepSeek-V3和Kimi K2上延迟最高降低56%,做MoE推理的同学可以关注这个优化思路。原文稍后读已读值得跟进有用关注 DA-MoE
03:14官方账号NVIDIA AI@NVIDIAAI精选NVIDIA AI使用ModelExpress(MX)将DeepSeek-V4 Pro的启动时间从8分钟缩短至不到2分钟,靠的是GPU-to-GPU RDMA快速传输权重。MX是NVIDIA Dynamo中的权重分发与缓存管理服务,它复用内核缓存,并通过NIXL让推理worker直接从其他GPU获取更新权重,避免集中广播。这一方法同样能加速推理和强化学习后训练。AI模型DeepSeek-V4 ProNVIDIA ModelExpressNVIDIA Dynamo5 个信源在谈事件专题推荐理由:NVIDIA把大模型冷启动快了4倍,DeepSeek-V4 Pro启动只要2分钟,靠ModelExpress和RDMA,推理和训练都能提速。原文稍后读已读值得跟进有用关注 DeepSeek-V4 Pro
22:40Guillermo Rauch@rauchg精选Vercel AI Gateway在首个token时间(TTFT)基准测试中表现最佳,无论冷启动还是热启动。开源基准测试由Ronny Badilla发布,结果显示Vercel在端到端延迟上胜出,而Cloudflare和OpenRouter在连接阶段(DNS+TCP+TLS)更快。开发者可根据工作负载选择不同网关。AI产品VercelAI GatewayTTFT推荐理由:Vercel放出了AI Gateway的TTFT基准,冷热启动都最快,还开源了测试代码,想比一比可以去跑。原文稍后读已读值得跟进有用关注 Vercel
11:57官方账号arXiv cs.LG@Krish Agarwal, Zhuoming Chen, Yanyuan Qin, Zhenyu Gu, Atri Rudra, Beidi ChenFlashRT 是一个引导编码智能体优化实时多模态应用部署的框架,将简单参考实现转化为多 GPU 部署。在 NVIDIA B200 GPU 上,FlashRT 将视频世界模型和多模态 LLM 的延迟降低达 70 倍,吞吐量提升 2.8 倍。在 AMD MI355X GPU 上,延迟降低持平,吞吐量提升达 3.6 倍。针对 Qwen3-Omni 文本到音频推理,FlashRT 在 AMD MI355X 上比专家 vLLM-Omni 实现减少 65% 响应延迟。AI模型FlashRTNVIDIAAMD7 个信源在谈事件专题推荐理由:部署多模态模型时延迟高吞吐低?FlashRT 让智能体自动优化,实测延时降 70 倍,吞吐升 3.6 倍,AMD 平台效果尤其猛。原文稍后读已读值得跟进有用关注 FlashRT
23:55elvis@omarsar0精选Robbyant 开源了 LingBot-VLA 2.0 的训练后代码。在单张 NVIDIA GeForce RTX 4090D 上,仅需 10 步去噪,推理耗时约 130 毫秒。这意味着用户无需集群即可进行适配和测试,大幅降低了部署门槛。AI模型LingBot-VLA 2.0RobbyantRTX 4090D10 个信源在谈事件专题推荐理由:Robbyant 把 LingBot-VLA 2.0 的训练后代码开源了,单张 RTX 4090D 跑出 130 毫秒推理,不用集群就能自己玩。原文稍后读已读值得跟进有用关注 LingBot-VLA 2.0
09:58官方账号arXiv cs.LG@Winfried van den dool, Patrick Forré, Amir Habibian, Yuki M. Asano, Max WellingAVQ-Attention 通过自适应向量量化将注意力复杂度从 O(N²) 降至 O(MN),其中 N 为 token 数,M 为码字数量。与固定码本的 VQ-Attention 不同,它根据注意力重要性动态分配码本容量,在高注意区域使用预学习的子码字进行细粒度量化,低注意区域维持粗粒度。方法基于自定义 Triton 内核,可在 Flash Attention 的平铺计算中完成重要性评分、子码字插入等操作,实现最小开销。实验表明 AVQ-Attention 在保持 O(MN) 复杂度的同时,相比固定码本 VQ-Attention 实现了更好的精度-效率权衡。AI模型AVQ-AttentionVQ-AttentionFlash Attention推荐理由:这篇论文提出了一个聪明的点子:让注意力机制像人一样,在关键地方用更多计算资源,其他地方粗略处理。复杂度降低但精度不降,做推理优化的同学可以关注。原文稍后读已读值得跟进有用关注 AVQ-Attention
09:30官方账号arXiv cs.AI@Daehoon Gwak, Minhyung Lee, Junwoo Park, Jaegul Choo本文对扩散大语言模型(dLLM)的推理加速技术进行了系统综述。研究指出,并行生成并不天然带来实际速度提升,需要专门推理机制如扩散感知缓存与复用。作者提出了一个统一的延迟分解框架,用于解耦算法、架构和系统层面的因素。文章从算法创新、架构与系统优化、推理时缩放三个维度对加速技术进行了分类。最后,给出了可重复基准测试的指南,并指出了实现并行生成潜力所面临的开放挑战。论文扩散模型大语言模型推理优化推荐理由:想了解怎么让扩散大模型跑得快?这篇综述把加速方法分了三个维度,还给了评测框架,搞推理优化的值得看。原文稍后读已读值得跟进有用关注 扩散模型
02:16官方账号Clement Delangue@ClementDelangue精选Clement Delangue 转推了 SpiritBun 的 VBR(Variable Bit Rate)KV 缓存格式。该格式在会话增长过程中逐层动态量化 KV 缓存,在 VRAM 限制内最大化生成质量。目前代码已合入主分支并可用。AI模型VBRKV缓存量化推荐理由:SpiritBun 搞了个新 KV 缓存格式 VBR,逐层动态量化,在显存限制内榨出最高质量,已开源可用。原文稍后读已读值得跟进有用关注 VBR
07:15官方账号NVIDIA AI@NVIDIAAI精选NVIDIA发布“AI Model Co-Design”系列文章,首篇探讨模型维度与GPU性能的关联。文章指出,调整模型维度(如宽度、深度)能直接影响GPU的计算效率。通过合理设计,可提升系统吞吐量和单用户响应速度。该系列旨在推动模型与硬件的协同优化。技巧NVIDIAGPU模型设计2 个信源在谈事件专题推荐理由:NVIDIA新系列讲模型和硬件怎么配合更高效,首篇教你调维度来榨干GPU性能,部署AI服务的人值得一看。原文稍后读已读值得跟进有用关注 NVIDIA
11:16官方账号Together AI@togethercompute精选Together AI 展示了 ATLAS 系统与 NVIDIA Blackwell、CUDA、TensorRT-LLM、Dynamo 以及自定义内核的协同优化。这套组合拳从 API 底层加速推理过程,降低用户端延迟。项目由 @realDanFu 及其团队主导,旨在提升大规模模型部署的推理效率。AI产品Together ATLASNVIDIA BlackwellTensorRT-LLM4 个信源在谈事件专题推荐理由:Together AI 把底层优化玩出花,ATLAS 加上 NVIDIA Blackwell 和一套 CUDA/TensorRT 工具,推理速度能快不少。搞部署的可以看看这套方案。原文稍后读已读值得跟进有用关注 Together ATLAS
07:37IT之家(博客/媒体)苹果正与PrismML接洽,评估其原生1-bit模型压缩技术。该技术将Qwen 3.6(27B参数)压缩至全精度1/14体积,内存占用降低超90%,推理速度提升最高8倍,能耗降低75%-80%,已在iPhone 17 Pro上完整运行。PrismML声称精度接近FP16模型,无“高精度逃生通道”。苹果希望借此增强本地AI推理性能。AI模型PrismMLQwen 3.6iPhone 17 Pro推荐理由:苹果想用这技术让27B的Qwen 3.6在手机上跑,速度比原来快8倍,能耗降75%,还能保持精度,挺牛的。原文稍后读已读值得跟进有用关注 PrismML
09:35官方一手arXiv: DeepSeek@Yihua Liu精选Floor-First提出一种基于残差驱动的LLM服务优化工作流,将每个解码步骤建模为五维资源向量(HBM字节、FLOPs、网络字节、网络消息、KV容量),通过求和与取最大值得到乐观下限与悲观下限区间,无需剖析器即可评估重叠质量。以DeepSeek-V3.2风格671B MoE/MLA模型在16块NVIDIA H20 GPU上验证:TP16解码在~74 FLOP/byte下受KV容量限制,仅支持约70并发8K请求;EP16+DP-attention布局将容量墙提升至~644,但单流延迟比TP慢2.4倍。该方法通过资源墙排序而非点基准比较部署方案,且支持新注意力模块的组合式接入。论文DeepSeek-V3.2H20LLM Serving4 个信源在谈事件专题推荐理由:别盲目跑网格搜索了。这篇论文提出Floor-First方法,用资源向量估算性能下限,在DeepSeek-V3.2上验证了不同注意力布局的容量墙差异,帮你理性选部署方案。原文稍后读已读值得跟进有用关注 DeepSeek-V3.2
01:01官方账号LangChain@LangChainAI精选LangChain调整了NVIDIA Nemotron 3 Ultra模型的推理框架,在基准测试中获得0.86的聚合分数,成本仅4.48美元。与之性能最接近的模型成本为43.48美元,实现了10倍的成本降低。该优化在保持领先性能的同时大幅降低了推理开销。AI模型NemotronNVIDIALangChain10 个信源在谈事件专题推荐理由:LangChain让Nemotron 3 Ultra跑分0.86,成本只要4.48刀,比对手便宜近10倍,性价比拉满。原文稍后读已读值得跟进有用关注 Nemotron
12:12官方账号arXiv cs.AI@Kai Ruan, Zihe Huang, Ziqi Zhou, Qianshan Wei, Xuan Wang, Hao Sun该论文利用LLM Agent每轮隐藏状态的探针(probe),在任务早期预测最终失败。在TextCraft基准上,Recall-Controlled Probe Cascade以90%召回率目标为Qwen-2.5-7B节省47.1%推理计算,为Llama-3.2-3B节省37.2%。相比仅基于行为的方法,节省量高出1.6-1.7倍。论文还推导了保证高召回率所需的样本复杂度。论文LLM AgentQwen-2.5-7BLlama-3.2-3B推荐理由:这篇论文告诉你如何从模型内部状态提前看出agent会失败,比看外部行为省算力多了,实测省三到四成。原文稍后读已读值得跟进有用关注 LLM Agent
16:29AI Will@FinanceYF5第三方服务商通过SGLang推理引擎、Prefill-Decode解耦架构、专家并行技术及AMD MI300 GPU,将DeepSeek模型的API调用成本降至官方价格的1/5。该技术栈组合显著降低了推理开销,使小型团队和企业能以更低成本使用高性能模型。方案中涉及的专家并行与Prefill-Decode分离是核心优化手段。技巧DeepSeekSGLangAMD MI300推荐理由:想低成本跑DeepSeek?有第三方用SGLang和AMD MI300把API成本压到官方的五分之一,技术方案公开,值得参考。原文稍后读已读值得跟进有用关注 DeepSeek
11:48官方一手arXiv: DeepSeek@Xiao Shi, Yingying Sun, Jiangsu Du, Zhiguang Chen, Yutong LuCAP框架通过协同激活驱动的专家放置减少跨设备通信,并引入通信感知剪枝选择性移除路由目标。在单节点和多节点实验中,相比DeepSeek EPLB和vLLM的序列放置,吞吐量提升1.23倍至1.86倍。该方法在达到相同加速目标时能保持更好的模型准确率。论文CAPMoEDeepSeek EPLB推荐理由:这篇论文提出CAP,直接在专家放置和剪枝中考虑通信开销,实测比DeepSeek EPLB快1.2-1.8倍,适合跑大MoE模型的人。原文稍后读已读值得跟进有用关注 CAP
15:45官方账号vLLM@vllm_project74°Qwen3-Omni采用多模态Thinker与Talker(Code2Wav)流水线架构。高并发下仅复制语音阶段,复用Thinker结果,首音频延迟从约6秒降至0.6秒。吞吐量在同GPU上提升5.4倍,语音生成快于实时。该优化由阿里、蚂蚁集团SCT团队和vLLM-Omni团队共同实现。AI模型Qwen3-Omni多模态推理优化推荐理由:阿里和蚂蚁团队搞了个优化,Qwen3-Omni实时对话延迟从6秒降到0.6秒,吞吐还翻了5倍多,推荐看技术博客。原文稍后读已读值得跟进有用关注 Qwen3-Omni
09:48官方一手arXiv: DeepSeek@Shrikara Arun, Anjaly Parayil, Srikant Bharadwaj, Renee St. Amant, Victor Rühle精选该论文针对分离式LLM服务中预填充节点过载而解码节点空闲的问题,提出了一种主动预填充偏转调度器。在2个预填充节点和2个解码节点的A100集群上,预填充执行仅占P95首次令牌延迟的2-23%,其余为排队和KV-cache传输。该调度器让解码节点以分块预填充步骤穿插解码批次的方式处理请求,消除节点间KV传输。基于vLLM和DeepSeek-V2-Lite的实验显示,相比最优分离式调度器,P95 TTFT降低81%,SLO达成率提升79%。论文Disaggregated LLM servingprefill deflectionvLLM推荐理由:这篇论文讲了个很实在的优化:让空闲的解码节点分担预填充活儿,不用等KV传输,TTFT降了81%原文稍后读已读值得跟进有用关注 Disaggregated LLM serving
03:03官方账号vLLM@vllm_project精选vLLM社区宣布,通过对DeepSeek V4模型的推理优化,一个月内将token成本降低5倍。优化工作从day-zero食谱起步,涉及内核、调度和服务层的改进。社区每个PR都对成本下降有贡献。AI产品DeepSeek V4vLLM推理优化推荐理由:vLLM社区一个月让DeepSeek V4的token成本降了5倍,优化方法值得做推理的同行参考。原文稍后读已读值得跟进有用关注 DeepSeek V4
20:29官方账号vLLM@vllm_project72°Qwen3.6-27B-NVFP4模型在vLLM上可用,针对NVIDIA Blackwell GPU优化。该检查点将GPU内存需求降低约2.5倍。模型拥有27B参数,采用混合注意力机制。在MMLU Pro上得分86.3,GPQA Diamond上得分85.5。仅支持vLLM作为运行时引擎。AI模型QwenvLLMNVIDIA Blackwell10 个信源在谈事件专题推荐理由:Qwen3.6-27B-NVFP4来了!在Blackwell上内存减半,MMLU Pro 86.3分,用vLLM就能跑,开源模型本地AI更省显存。原文稍后读已读值得跟进有用关注 Qwen
13:44IT之家(博客/媒体)81°英伟达在 Blackwell 平台上优化 DeepSeek V4 模型推理,单 Token 成本降至原先的五分之一。Blackwell 平台通过生产运营层、应用加速层、基础设施访问层三层优化,实现分布式服务、专家并行、NVLink 通信等技术。优化后单 GPU token 吞吐量最高提升 20 倍。英伟达将单 Token 成本列为 AI 总拥有成本的核心指标。AI模型NVIDIADeepSeek V4Blackwell6 个信源在谈事件专题推荐理由:英伟达把 DeepSeek V4 的推理成本砍到五分之一,单 GPU 吞吐量暴增 20 倍,选 Blackwell 做推理的可以闭眼冲了。原文稍后读已读值得跟进有用关注 NVIDIA
02:02官方账号Decoder@Matthias Bastian据 The Information 报道,OpenAI 将 AI 模型的推理成本降低超过一半。这项优化已应用于 ChatGPT,使得响应 guest 用户所需的 Nvidia GPU 数量有时降至仅几百块。这一调整显著降低了运营成本。AI产品ChatGPTOpenAI推理优化10 个信源在谈事件专题推荐理由:OpenAI 给免费用户省了钱,自家推理成本砍半,GPU 数量降到了几百块,效率提了不少。原文稍后读已读值得跟进有用关注 ChatGPT
00:46官方账号LMSYS Org (SGLang)@lmsysorg精选72°SGLang 集成百度无限 OCR 功能,通过参考滑动窗口注意力(R-SWA)替换传统解码注意力,使 KV 缓存大小在整个解码过程中保持恒定。该方案在单次前向传播中可处理最长 32K token 的文本,转录数十页文档。其高压缩率来自 DeepSeek OCR 编码器,且 R-SWA 方法可扩展至 ASR、翻译等任务。AI产品SGLangOCR百度推荐理由:SGLang 新功能无限 OCR 能一口气处理几十页文档,显存占用不变,比传统注意力省资源,适合长文档批量 OCR 场景。原文稍后读已读值得跟进有用关注 SGLang
10:36官方一手arXiv: DeepSeek@Hui Zang, Pengfei Xia, Hong Liu, Jiajia Chu, Tuo Hao, Minghao Chen, Rui Zhang, Ziyang Zhang精选Mixture-of-Experts (MoE)架构通过稀疏激活扩展模型规模,但数据移动瓶颈导致推理效率低下。两个关键问题:低贡献专家带来几乎均等的内存与传输成本(成本收益比低),以及多设备部署中受最慢设备限制。CAEE框架利用轻量级成本模型估算硬件开销,选择性剪枝低重要性高成本专家,并通过低开销补偿机制避免额外数据传输。在DeepSeek-R1(671B参数)上的评估显示,CAEE将端到端推理延迟降低8%-18%(专家卸载与设备内执行),模型准确率下降小于1%。论文CAEEMoEDeepSeek-R1推荐理由:CAEE框架能降低MoE模型推理延迟8%-18%,且准确率几乎不受影响。DeepSeek-R1用户可重点关注。原文稍后读已读值得跟进有用关注 CAEE
13:51官方账号Together AI@togethercomputeTogether AI 构建了基于 Parakeet 的语音转文本堆栈,每秒可处理约 302 秒音频,这是 Artificial Analysis 报告中最高速度因子。该堆栈在 Together 平台上运行,通过系统级优化实现低延迟转录。文章由 @FeelTheBeurn 详细拆解了背后的工程工作。AI模型ParakeetTogether AI语音识别推荐理由:Together AI 把 Parakeet 优化到每秒转写 302 秒音频,比别的服务快一大截,想搞语音识别的可以看看这篇系统调优拆解。原文稍后读已读值得跟进有用关注 Parakeet
13:09官方账号vLLM@vllm_project精选vLLM-Omni TTS团队针对Qwen3-TTS、VoxCPM2、Higgs Audio V3、Fish Speech S2 Pro四种TTS模型分别设计了不同的优化策略。对Qwen3-TTS通过解耦连接器分块和批处理Stage-0解码预处理,在H20×2上音频吞吐量提升61.5%,P99延迟减半。VoxCPM2采用whole-forward torch.compile和CFM/LocDiT解码尾部跨请求批处理,音频吞吐量提升172%。Higgs Audio V3将多码本解码状态机迁移到GPU驻留张量,实现2.7倍加速。Fish Speech S2 Pro为纯解码路径设计了模型特定的q_len=1 Triton注意力内核。AI模型vLLMQwen3-TTSVoxCPM2推荐理由:vLLM团队分享了优化四种主流TTS模型服务的具体技巧,包括性能提升数据和实现细节,对部署TTS服务很有参考价值。原文稍后读已读值得跟进有用关注 vLLM
00:21berryxia@berryxia精选73°DeepSeek开源了DSpark投机解码框架,用于推理优化。DSpark通过并行backbone加顺序Markov head解决传统投机解码的后缀衰减问题,并引入置信度调度和负载感知调度器。在DeepSeek-V4生产环境中,单用户生成速度比MTP-1基线快60-85%,不同场景吞吐提升1.5x到5x。开源内容包括DeepSeek-V4-Pro-DSpark和DeepSeek-V4-Flash-DSpark模型checkpoint以及MIT协议的DeepSpec训练代码。AI模型DeepSeekDSparkDeepSeek-V4推荐理由:DeepSeek开源了DSpark框架,能让你的V4模型推理提速60%以上,且不影响质量。它解决了投机解码在真实部署中的难题,已经稳定跑在生产环境。原文稍后读已读值得跟进有用关注 DeepSeek
16:36官方一手Pandaily@contact@pandaily.com (Pandaily)76°北京大学与DeepSeek联合开源了投机解码框架DSpark,该框架无需修改模型即可将LLM推理速度提升60-85%。在严格延迟约束下,吞吐量增益最高达661%。DSpark通过高效的投机解码策略显著降低推理延迟。这一成果已在GitHub上开源。AI模型Peking UniversityDeepSeekDSpark推荐理由:北大和DeepSeek搞的DSpark,不用改模型就能让推理快80%,吞吐量翻好几倍,适合做部署的试试。原文稍后读已读值得跟进有用关注 Peking University