8月17日
17:08
17:08官方一手pandaily@contact@pandaily.com (Pandaily)
精选
北京大学、StepFun与北京邮电大学提出TensorCast,一种面向大模型基础设施的统一可编程张量生命周期管理抽象。在高并发多轮智能体场景中,TensorCast将中位首Token延迟最高降低93.2%。模型实例启动速度最高提升228.6倍。该方案由三所机构联合提出。

推荐理由:北大和StepFun搞了个TensorCast,把大模型首Token延迟砍掉九成多,高并发多轮对话场景下很猛。
8月15日
8月14日
7月30日
06:26
06:26官方账号Greg Brockman@gdb
78°
OpenAI 发布了 GPT-5.6 Sol,专门用于提升生产环境的服务效率。部署后,该模型通过自我优化机制进一步降低运行成本。具体改进包括:GPU 内核优化使服务成本降低 20%;推测解码算法改进使 token 生成效率提升超过 15%。
事件专题

推荐理由:OpenAI 搞了个新模型 GPT-5.6 Sol,能自己优化自己,部署后服务成本直接降了20%,生成速度还快了15%,搞推理服务的值得关注。
7月21日
11:57
11:57官方账号arXiv cs.LG@Krish Agarwal, Zhuoming Chen, Yanyuan Qin, Zhenyu Gu, Atri Rudra, Beidi Chen
FlashRT 是一个引导编码智能体优化实时多模态应用部署的框架,将简单参考实现转化为多 GPU 部署。在 NVIDIA B200 GPU 上,FlashRT 将视频世界模型和多模态 LLM 的延迟降低达 70 倍,吞吐量提升 2.8 倍。在 AMD MI355X GPU 上,延迟降低持平,吞吐量提升达 3.6 倍。针对 Qwen3-Omni 文本到音频推理,FlashRT 在 AMD MI355X 上比专家 vLLM-Omni 实现减少 65% 响应延迟。
事件专题

推荐理由:部署多模态模型时延迟高吞吐低?FlashRT 让智能体自动优化,实测延时降 70 倍,吞吐升 3.6 倍,AMD 平台效果尤其猛。
7月15日
23:55
23:55elvis@omarsar0
精选
Robbyant 开源了 LingBot-VLA 2.0 的训练后代码。在单张 NVIDIA GeForce RTX 4090D 上,仅需 10 步去噪,推理耗时约 130 毫秒。这意味着用户无需集群即可进行适配和测试,大幅降低了部署门槛。
事件专题

推荐理由:Robbyant 把 LingBot-VLA 2.0 的训练后代码开源了,单张 RTX 4090D 跑出 130 毫秒推理,不用集群就能自己玩。
02:16
7月14日
07:15
07:15官方账号NVIDIA AI@NVIDIAAI
精选
NVIDIA发布“AI Model Co-Design”系列文章,首篇探讨模型维度与GPU性能的关联。文章指出,调整模型维度(如宽度、深度)能直接影响GPU的计算效率。通过合理设计,可提升系统吞吐量和单用户响应速度。该系列旨在推动模型与硬件的协同优化。
事件专题

推荐理由:NVIDIA新系列讲模型和硬件怎么配合更高效,首篇教你调维度来榨干GPU性能,部署AI服务的人值得一看。
7月13日
11:16
11:16官方账号Together AI@togethercompute
精选
Together AI 展示了 ATLAS 系统与 NVIDIA Blackwell、CUDA、TensorRT-LLM、Dynamo 以及自定义内核的协同优化。这套组合拳从 API 底层加速推理过程,降低用户端延迟。项目由 @realDanFu 及其团队主导,旨在提升大规模模型部署的推理效率。
事件专题

推荐理由:Together AI 把底层优化玩出花,ATLAS 加上 NVIDIA Blackwell 和一套 CUDA/TensorRT 工具,推理速度能快不少。搞部署的可以看看这套方案。
7月9日
01:01
01:01官方账号LangChain@LangChainAI
精选
LangChain调整了NVIDIA Nemotron 3 Ultra模型的推理框架,在基准测试中获得0.86的聚合分数,成本仅4.48美元。与之性能最接近的模型成本为43.48美元,实现了10倍的成本降低。该优化在保持领先性能的同时大幅降低了推理开销。
事件专题

推荐理由:LangChain让Nemotron 3 Ultra跑分0.86,成本只要4.48刀,比对手便宜近10倍,性价比拉满。
7月8日
12:12
12:12官方账号arXiv cs.AI@Kai Ruan, Zihe Huang, Ziqi Zhou, Qianshan Wei, Xuan Wang, Hao Sun
该论文利用LLM Agent每轮隐藏状态的探针(probe),在任务早期预测最终失败。在TextCraft基准上,Recall-Controlled Probe Cascade以90%召回率目标为Qwen-2.5-7B节省47.1%推理计算,为Llama-3.2-3B节省37.2%。相比仅基于行为的方法,节省量高出1.6-1.7倍。论文还推导了保证高召回率所需的样本复杂度。
推荐理由:这篇论文告诉你如何从模型内部状态提前看出agent会失败,比看外部行为省算力多了,实测省三到四成。
7月7日
11:48
11:48官方一手arXiv: DeepSeek@Xiao Shi, Yingying Sun, Jiangsu Du, Zhiguang Chen, Yutong Lu
CAP框架通过协同激活驱动的专家放置减少跨设备通信,并引入通信感知剪枝选择性移除路由目标。在单节点和多节点实验中,相比DeepSeek EPLB和vLLM的序列放置,吞吐量提升1.23倍至1.86倍。该方法在达到相同加速目标时能保持更好的模型准确率。
推荐理由:这篇论文提出CAP,直接在专家放置和剪枝中考虑通信开销,实测比DeepSeek EPLB快1.2-1.8倍,适合跑大MoE模型的人。
7月3日
15:45
15:45官方账号vLLM@vllm_project
74°
Qwen3-Omni采用多模态Thinker与Talker(Code2Wav)流水线架构。高并发下仅复制语音阶段,复用Thinker结果,首音频延迟从约6秒降至0.6秒。吞吐量在同GPU上提升5.4倍,语音生成快于实时。该优化由阿里、蚂蚁集团SCT团队和vLLM-Omni团队共同实现。

推荐理由:阿里和蚂蚁团队搞了个优化,Qwen3-Omni实时对话延迟从6秒降到0.6秒,吞吐还翻了5倍多,推荐看技术博客。
03:03
7月2日
20:29
20:29官方账号vLLM@vllm_project
72°
Qwen3.6-27B-NVFP4模型在vLLM上可用,针对NVIDIA Blackwell GPU优化。该检查点将GPU内存需求降低约2.5倍。模型拥有27B参数,采用混合注意力机制。在MMLU Pro上得分86.3,GPQA Diamond上得分85.5。仅支持vLLM作为运行时引擎。
事件专题

推荐理由:Qwen3.6-27B-NVFP4来了!在Blackwell上内存减半,MMLU Pro 86.3分,用vLLM就能跑,开源模型本地AI更省显存。
7月1日
02:02
02:02官方账号Decoder@Matthias Bastian
据 The Information 报道,OpenAI 将 AI 模型的推理成本降低超过一半。这项优化已应用于 ChatGPT,使得响应 guest 用户所需的 Nvidia GPU 数量有时降至仅几百块。这一调整显著降低了运营成本。
事件专题

推荐理由:OpenAI 给免费用户省了钱,自家推理成本砍半,GPU 数量降到了几百块,效率提了不少。
00:46
00:46官方账号LMSYS Org (SGLang)@lmsysorg
精选72°
SGLang 集成百度无限 OCR 功能,通过参考滑动窗口注意力(R-SWA)替换传统解码注意力,使 KV 缓存大小在整个解码过程中保持恒定。该方案在单次前向传播中可处理最长 32K token 的文本,转录数十页文档。其高压缩率来自 DeepSeek OCR 编码器,且 R-SWA 方法可扩展至 ASR、翻译等任务。

推荐理由:SGLang 新功能无限 OCR 能一口气处理几十页文档,显存占用不变,比传统注意力省资源,适合长文档批量 OCR 场景。
6月29日
13:51
13:51官方账号Together AI@togethercompute
Together AI 构建了基于 Parakeet 的语音转文本堆栈,每秒可处理约 302 秒音频,这是 Artificial Analysis 报告中最高速度因子。该堆栈在 Together 平台上运行,通过系统级优化实现低延迟转录。文章由 @FeelTheBeurn 详细拆解了背后的工程工作。

推荐理由:Together AI 把 Parakeet 优化到每秒转写 302 秒音频,比别的服务快一大截,想搞语音识别的可以看看这篇系统调优拆解。
6月28日
16:36
16:36官方一手Pandaily@contact@pandaily.com (Pandaily)
76°
北京大学与DeepSeek联合开源了投机解码框架DSpark,该框架无需修改模型即可将LLM推理速度提升60-85%。在严格延迟约束下,吞吐量增益最高达661%。DSpark通过高效的投机解码策略显著降低推理延迟。这一成果已在GitHub上开源。

推荐理由:北大和DeepSeek搞的DSpark,不用改模型就能让推理快80%,吞吐量翻好几倍,适合做部署的试试。