02:05Philipp Schmid@_philschmid精选Awesome Gemma 资源库已在 GitHub 上线。该库收录了 16 个 Gemma 模型变体的模型卡片和合集。它还提供了 Ollama、vLLM 和 LiteRT 的设置指南。此外,库中包含 Unsloth、Tunix 和 MLX 的微调教程。社区项目、应用和演示也包含在内。AI产品GemmaGoogleOllama推荐理由:Google 的 Awesome Gemma 资源库上线了,里面有你想要的模型卡片、部署指南和微调教程,比自己找方便多了。原文稍后读已读值得跟进有用关注 Gemma
10:12官方一手arXiv: Anthropic@José A. Perdiguero López, Miguel A. Durán-OlivenciaFlama是一个开源Python框架,基于Asynchronous Server Gateway Interface(ASGI),用于开发部署生产级web API、机器学习服务和大型语言模型(LLM)应用;其子系统包含依赖注入系统,可从类型注解解析参数,还支持Pydantic等格式;内置JWT认证、WebSocket端点等功能,可通过命令行界面管理应用。AI模型FlamavLLMMLX推荐理由:Flama这个开源框架,能帮你开发部署生产级API和LLM服务,和普通框架比更统一架构,还能自动处理多种模型格式。原文稍后读已读值得跟进有用关注 Flama
00:25官方账号阿里通义 Qwen@Alibaba_Qwen81°阿里发布 Qwen3.8-27B,单张 Blackwell GPU 即可部署,原生上下文 262K,可扩展至 1M。模型采用与 2.4T 旗舰相同的混合骨干架构,但为 dense 而非 MoE。vLLM 提供 Day-0 支持,内置 MTP 草稿头,短提示词接受率在 BF16 下为 92.2%、FP8 下为 84.8%。在 NVIDIA GB300 上完成端到端验证,支持 BF16/FP8 TP4 与 NVFP4 TP1,工具调用和 1M 上下文生成均正常。AI模型Qwen3.8-27BvLLM长上下文7 个信源在谈事件专题推荐理由:阿里发了能塞进单卡GPU的27B模型,长上下文到1M,vLLM当天就能用。适合想自己部署长上下文开源模型的开发者。原文稍后读已读值得跟进有用关注 Qwen3.8-27B
21:45官方账号NVIDIA AI@NVIDIAAI精选Meta 旗下 Superintelligence Labs 发布首个开源权重模型 Muse Glimmer 30B,采用 Apache 2.0 许可。该模型为 30B 稠密架构,支持 128K 以上上下文,具备多模态能力,面向本地智能体场景。vLLM 在发布当天即提供 Day-0 支持,用户可通过命令 vllm serve meta-models/Muse-Glimmer-30B 在自有设备上运行。官方称其既能应对长周期任务,又可在用户自持硬件上运行。AI模型Muse Glimmer 30BMetavLLM推荐理由:Meta 把 30B 多模态模型开源了,Apache 2.0,还能跑在本地,vLLM 当天就支持,想试的直接装。原文稍后读已读值得跟进有用关注 Muse Glimmer 30B
08:11a16z@a16z71°a16z官方账号发布访谈视频,vLLM维护者、Inferact CEO Simon Mo与合伙人Matt Bornstein讨论开源权重模型的价值。Simon Mo认为世界不能被专有API垄断,闭源模型成本过高,而开源权重允许企业自行控制基础设施、扩展模型或添加护栏。他提到,控制问题近两年一直重要,成本问题从近几个月开始凸显,例如语音智能体公司需要自有模型保证响应时间。访谈还提及vLLM目前在任意时刻运行于约50万块GPU上,并讨论了Kimi K3的发布与开源模型许可证变化。行业开源模型vLLMInferact10 个信源在谈事件专题推荐理由:Simon Mo是vLLM作者,他讲开源权重模型怎么在成本和控制上赢过闭源API,还吐槽专有API宕机问题,适合做线上服务的开发者。原文稍后读已读值得跟进有用关注 开源模型
04:17a16z@a16zSimon Mo认为开源权重模型与闭源权重模型在能力上没有明显差距,差异主要在分发策略和进入市场方式。他提到vLLM目前运行在50万个GPU上,证明开源基础设施的规模。Mo指出关键不在于数据来源,而在于谁能构建更好的训练环境并做出更优的算法选择。他认为接下来一年开源模型实验室将专注于让模型适应真实世界,一年后两者差距将消失。行业vLLMInferact开源模型推荐理由:Simon Mo说开源模型和闭源模型能力没差多少,关键看谁把模型落地做得更好,vLLM已经在50万GPU上跑了。原文稍后读已读值得跟进有用关注 vLLM
02:43a16z@a16z71°vLLM是一个开源推理引擎,任意时刻运行在约50万张GPU上,构成开源模型生产环境的隐形基础设施。Simon Mo作为vLLM维护者和Inferact CEO,在a16z播客中讨论了开放模型的优势、发布首日模型适配的幕后冲突,以及Kimi K3实际带来的提升。他还对比了OpenRouter、Ollama等工具在ChatGPT出现前的起源,并解释了开源模型许可证正在变化的原因。访谈也涉及如何基于开源项目建立公司。行业vLLMInferactKimi K310 个信源在谈事件专题推荐理由:vLLM同时占着50万张GPU,却是开源模型的隐身基座。听Simon Mo拆解Kimi K3和开源模型上生产的坑。原文稍后读已读值得跟进有用关注 vLLM
09:43官方账号arXiv cs.LG@Xiang Li, Pengcheng Wang, Huazheng Wang, Saurabh BagchiSALT 提出三阶段分层微调框架:先在域内公共数据上联合训练高容量质心,再用 r≤2 的残差适配器在私有数据上微调,推理时固定质心、按需交换残差。相比 SOTA 压缩基线,该方法在多种 LLM 上取得最高 18.5% 的绝对准确率提升。每适配器显存占用降低至多 16 倍。集成进 vLLM 后,Llama-3.2-3B 的服务器吞吐在 PCIe 带宽压力下提升 51%,在 GPU 显存约束下提升 28%。论文SALTLoRAvLLM推荐理由:LoRA 服务老被显存和 PCIe 卡脖子?SALT 用 r≤2 的残差加固定质心,精度追上高秩,vLLM 吞吐最高多 51%。原文稍后读已读值得跟进有用关注 SALT
07:42elvis@omarsar0精选72°TokTier提出有状态分词方法,解决智能体场景下代码转录重复提交导致的分词不可复用问题。在153,951次真实智能体调用中,提示缓存命中率94.1%时,分词仍占用首token时延的64%。该方法只对追加位置附近的小窗口重新分词,并通过稳定边界检查拼接,在17个分词器家族的1.5e10次分割检查中零偏差。增量修复100K到3M字符耗时0.5至1.1毫秒,比HuggingFace快最多437倍;在vLLM下中位首token时延下降16%至34%。论文TokTiervLLM智能体推荐理由:做智能体服务的朋友看下,TokTier把长记录重复分词干掉了,vLLM下首字延迟降16%-34%,省GPU。原文稍后读已读值得跟进有用关注 TokTier
09:43官方账号arXiv cs.LG@Peter Li, Prashant PandeyInferScale 提出一种 GPU 原生的 KV 缓存注入方案,将每个记忆事实的 KV 表示预计算并存储在 GPU 上,服务时直接注入 vLLM 的页式缓存,避免重复预填。他们引入 Chunked RoPE 解决动态组装记忆的位置编码问题,并用 Context-Window Encoding 弥补独立编码缺失的跨事实上下文。在 LoCoMo 基准上,k=50 时 TTFT 降低 72-79%(3.6-4.8x),吞吐量提升 3.7-4.5x,准确率(60.3%)接近带服务时重计算的 Mem0(63.3%)。无需修改引擎或微调模型即可集成到 vLLM。论文InferScalevLLMKV缓存推荐理由:看完这篇论文,你就明白怎么让 LLM 在有多层记忆时不再反复重算——InferScale 直接把 KV 缓存存好,做到检索量再大 TTFT 基本不变。原文稍后读已读值得跟进有用关注 InferScale
02:46官方账号vLLM@vllm_project72°蚂蚁集团Ling团队发布Ling-3.0-flash,一款124B参数的MoE模型,每个token仅激活5.1B参数。该模型采用混合线性注意力机制,支持原生256K上下文窗口,面向生产级智能体系统。vLLM项目祝贺其发布,并称赞其“先公告后开源”的发布模式。vLLM将在模型权重开源时提供支持,预计vLLM开源支持即将到来。AI模型Ling-3.0-flashAntLingAGIvLLM推荐理由:蚂蚁的Ling-3.0-flash参数大但激活少,256K上下文,vLLM确认后续支持,开源在即。原文稍后读已读值得跟进有用关注 Ling-3.0-flash
03:07官方账号vLLM@vllm_project精选PrimeIntellect 发布了 prime-rl 0.6.0,在 vLLM 上运行万亿级 agentic RL 推理。该版本采用 FP8 量化、专家并行、prefill/decode 分离以及 KV 缓存卸载(原生+Mooncake),并使用 vllm-router。在 28 个 H200 节点上,以 131k 序列长度训练 GLM-5 执行 SWE 任务,每步耗时不到 5 分钟。@m_sirovatka 将在 vLLM Office Hours 中深入讲解。AI模型PrimeIntellectprime-rlvLLM推荐理由:PrimeIntellect 用 vLLM 把 agentic RL 搞到万亿参数级了,FP8 加专家并行,28 个 H200 节点跑 131k 序列,每步不到 5 分钟,训练 GLM-5 做 SWE 任务。原文稍后读已读值得跟进有用关注 PrimeIntellect
14:49官方账号vLLM@vllm_project精选vLLM 项目昨晚举办了回归后的首次 meetup,由 vLLM 与 CrusoeAI、inferact 联合主办。vLLM 核心贡献者 Simon Mo、zlxi02 和 zijingliu 分别介绍了 vLLM 路线图、agentic workloads 以及生产级 vLLM 部署经验。活动还得到了 a16z 的支持。行业vLLMCrusoeAIinferact推荐理由:vLLM 社区又聚在一起了,这次聊了路线图和 agent 负载,还和 CrusoeAI、a16z 联手,挺有料的。原文稍后读已读值得跟进有用关注 vLLM
14:21官方账号vLLM@vllm_project精选Macaron 团队发布了 Macaron-V1-Venti,一个基于 vLLM 的多 LoRA 路由系统。其开源组件 MoL Harness 可将多个 LoRA 专家模型统一在 OpenAI 兼容端点后,并自动路由请求。该系统利用了 vLLM 原生的 Multi-LoRA 服务。从发布首日即支持 vLLM。AI产品Macaron-V1-VentiMoL HarnessvLLM10 个信源在谈事件专题推荐理由:Macaron 搞了个好东西:把多个 LoRA 模型挂在一个接口后,自动路由,基于 vLLM 直接上线。原文稍后读已读值得跟进有用关注 Macaron-V1-Venti
14:20官方账号vLLM@vllm_project82°NVIDIA 发布 Cosmos 3 Edge,一个4B参数的设备端世界模型,基于自研Nemotron骨干从零训练。模型采用双Transformer塔架构:自回归塔处理视觉/文本推理,扩散塔负责预测、生成和动作输出。在640×360分辨率下,单次推理可输出32个动作,于Jetson Thor上实现15Hz实时控制。vLLM和vLLM Omni已提供即日支持,可用于机器人、自动驾驶和视觉代理。AI模型NVIDIA Cosmos 3 EdgevLLM世界模型5 个信源在谈事件专题推荐理由:NVIDIA发了能在设备上实时跑的世界模型,4B参数,15Hz控制机器人,vLLM直接就能用。原文稍后读已读值得跟进有用关注 NVIDIA Cosmos 3 Edge
04:33官方账号Cohere@coherelisten-habibi 是一个基于 Cohere Transcribe Arabic 和 vLLM 的开源工具,通过 Docker 运行,可将 YouTube 链接或本地音频/视频文件中的阿拉伯语音频自动转录为文本。它处理语音提取、格式转换、长音频分段并输出文本文件,适用于播客、讲座、访谈等场景。项目代码托管在 GitHub,支持一键部署。AI产品listen-habibiCohere Transcribe ArabicvLLM推荐理由:这个工具专门针对阿拉伯语语音转录,用 Cohere 的模型,跑在 Docker 里插链接或文件就能出文本,做阿拉伯语内容的朋友可以试试。原文稍后读已读值得跟进有用关注 listen-habibi
20:27官方账号vLLM@vllm_projectvLLM团队在一篇技术文章中拆解了保持生产质量的开发流程。该项目每月合并约2000个提交,每两周发布一次。团队将流程分为三个层次来保证稳定性与迭代速度。文章还感谢了社区贡献者的努力。行业vLLM社区LLM推理推荐理由:这篇讲了vLLM怎么在猛合代码的同时还保持稳定,做推理部署的可以看看。原文稍后读已读值得跟进有用关注 vLLM
20:25官方账号vLLM@vllm_project83°Kimi Moonshot 发布新模型 Kimi K3,并将 KDA 前缀缓存实现直接贡献给 vLLM。KDA 突破了传统前缀缓存的假设,可提升长上下文服务的效率。vLLM 将在发布当天(July 27, 2026)开放权重时同步支持 K3 模型。该合作确保了社区从第一天起就能高效使用长上下文推理。AI模型Kimi K3vLLMKDA前缀缓存10 个信源在谈事件专题推荐理由:Kimi 和 vLLM 合作搞了个新缓存方案,K3 模型上来就能高效处理长文本,开源权重明年7月放出来。原文稍后读已读值得跟进有用关注 Kimi K3
03:02官方账号vLLM@vllm_project84°Thinking Machines Lab发布了TML Inkling,一个1T参数的开源权重模型,支持文本、图像和音频多模态输入。其上下文窗口高达100万token,采用相对注意力、短卷积和MoE专家汇聚的新架构,并配备8个MTP头用于推测解码。vLLM已从首日支持该模型,在NVIDIA Blackwell和Hopper上运行,4×GB200 MTP可达380 tok/s/user。AI模型TML InklingThinking Machines LabvLLM10 个信源在谈事件专题推荐理由:1T参数的开源多模态模型,百万token上下文,vLLM直接跑,4×GB200飙到380 tok/s,值得试试。原文稍后读已读值得跟进有用关注 TML Inkling
03:01官方账号vLLM@vllm_projectvLLM 项目宣布将于 2026 年 8 月 24 日至 26 日在旧金山举办首届 vLLM 会议,作为 Ray Summit 2026 的一部分。该会议将汇集 vLLM 的开发者、维护者及社区成员,进行线下交流。详细信息可通过链接查看。行业vLLMRay Summit社区活动推荐理由:vLLM 社区第一次线下聚会,就在 Ray Summit 上,开发者可以当面聊聊性能优化和部署经验。原文稍后读已读值得跟进有用关注 vLLM
10:38官方账号vLLM@vllm_project精选vLLM项目实现了预填充与解码分离,TileRT通过vLLM V1连接器将自身低延迟解码引擎与vLLM预填充配对,无需修改vLLM代码。原生vLLM解码默认用于吞吐场景,TileRT解码用于延迟敏感场景(如智能体、实时助手)。TileRT在GLM-5.1-FP8(8×B200)上单用户解码达618 tok/s,启用推测解码(MTP)后约为无MTP基线的2倍,峰值接近800 tok/s。AI模型vLLMTileRTGLM-5.1-FP8推荐理由:vLLM拆开预填充和解码,TileRT提供低延迟解码,单用户618 tok/s,适合实时助手。原文稍后读已读值得跟进有用关注 vLLM
13:56官方账号vLLM@vllm_project精选76°AMD团队将ROCm支持引入vime,vime是vLLM生态的RL后训练框架,端到端RL后训练现在原生运行在AMD Instinct MI355X GPU上。vime使用vLLM作为rollout后端,在ROCm上继承完整vLLM栈,无需独立代码路径。AMD验证了pipeline并上游了ROCm修复,提供了预构建容器。支持GRPO训练、colocated和非colocated训练/rollout、Megatron-LM训练+vLLM rollout、Qwen3密集和MoE模型。在MI355X上,Qwen3-8B达到约4100 tokens/gpu/s,训练-rollout logprob差异低且稳定。AI产品AMDROCmvime推荐理由:AMD给vLLM生态的RL训练框架vime加了ROCm支持,现在你的Qwen3-8B在MI355X上能跑到4100 tokens/gpu/s,训练和rollout的logprob很稳,还直接提供预构建容器,省去编译麻烦。原文稍后读已读值得跟进有用关注 AMD
13:55官方账号vLLM@vllm_project精选NVIDIA NeMo 团队发布了新的智能体优先强化学习框架 Molt,采用 vLLM(基于 Ray)作为 rollout 引擎。vLLM 支持快速异步服务,最高可扩展至 1T 级 MoE 规模,且易于集成,让上层的强化学习核心保持小巧和可修改。AI模型vLLMMoltNVIDIA10 个信源在谈事件专题推荐理由:vLLM 被 NVIDIA 新框架 Molt 选为 rollout 主力,支持 1T 级 MoE 规模,想搞强化学习可以试试这套组合。原文稍后读已读值得跟进有用关注 vLLM
06:00官方账号Clement Delangue@ClementDelangue77°Hugging Face 宣布 Transformers 模型现在可以直接在 vLLM 推理引擎中运行,达到原生速度,部分场景超越手写实现。此前,新模型架构需要在 Transformers(训练/研究)和 vLLM(生产推理)中分别实现,导致重复工作与维护成本。现在,模型作者只需在 Transformers 中实现一次,即可自动兼容 vLLM 的优化栈。在 4B 到 235B 参数模型的基准测试中,包括张量并行和 MoE 设置,Transformers 后端吞吐量匹配或超过原生 vLLM。AI模型Hugging FaceTransformersvLLM推荐理由:Hugging Face 把 Transformers 模型直接跑进 vLLM,性能不输手写,以后搞推理不用重复造轮子了。原文稍后读已读值得跟进有用关注 Hugging Face
02:17官方账号vLLM@vllm_project精选Novita Labs 训练并开源了 DSpark 投机解码器,用于 Kimi-K2.6 和 Kimi-K2.7-Code 模型。DSpark 是 DeepSeek 提出的投机解码方法,能一次性生成整个 token 块。vLLM 从 v0.25.0 版本起原生支持 DSpark。使用该解码器可加快 Kimi 系列的推理速度。AI模型Kimi-K2.6Kimi-K2.7-CodeDSpark推荐理由:DeepSeek 的 DSpark 投机解码,能让 Kimi-K2.6 和 K2.7-Code 一次生成整块 token,配合 vLLM 0.25.0 原生支持,解码更快。原文稍后读已读值得跟进有用关注 Kimi-K2.6
14:41官方账号vLLM@vllm_project精选PrimeIntellect推出Verifiers v1,使用vLLM进行训练rollouts,确保精确的token IDs和logprobs。该方法消除了tokenization漂移,使rollouts与训练保持同步。vLLM还支持开源RL基础设施如prime-rl。这一发布提升了强化学习训练的稳定性和效率。AI模型PrimeIntellectVerifiersvLLM推荐理由:PrimeIntellect发了Verifiers v1,用vLLM做强化学习rollout,token精度更高,训练更稳定。搞开源RL的可以看看。原文稍后读已读值得跟进有用关注 PrimeIntellect
20:30官方账号vLLM@vllm_project78°vLLM v0.25.0 正式发布,包含 558 次提交和 232 位贡献者。Model Runner V2 现已成为所有密集模型的默认执行路径,同时旧版 PagedAttention 实现被移除。Transformers 后端的运行速度已与原生 vLLM 持平。新增统一流解析引擎,以及支持跨异构词汇表的通用推测解码(TLI),并引入 DSpark 和 DFlash 起草器。新模型支持包括 Hy3 和 Unlimited OCR。AI产品vLLMModel Runner V2推测解码推荐理由:vLLM新版本把Model Runner V2设成了默认,推理更快更稳,还新增了流解析和推测解码,想优化部署性能的话可以关注。原文稍后读已读值得跟进有用关注 vLLM
20:29官方账号vLLM@vllm_project精选72°Cohere 团队开发了硬件感知的动态投机解码(Dynamic SD)并合并到 vLLM 项目。传统方法使用固定数量的草稿 token,而 DSD 会根据批次大小和硬件自适应调整。在有利场景下实现加速,在不利场景下回退以保持性能。该更新提升了 vLLM 在推理时的效率。AI模型CoherevLLMDynamic SD推荐理由:vLLM 合并了 Cohere 的动态投机解码,能根据硬件和批次大小自适应,想提升推理速度的可以试试。原文稍后读已读值得跟进有用关注 Cohere
23:28官方一手AWS Machine Learning Blog@Xuan Lu精选本教程展示了如何在Amazon SageMaker HyperPod上使用vLLM实现DPD(分离预填充和解码)。DPD通过将预填充阶段和解码阶段分别部署在不同的计算节点上,显著降低了推理延迟。文中提供了使用HyperPod推理操作符的具体配置步骤和性能对比数据。该方法适用于需要低延迟响应的LLM推理场景。技巧SageMaker HyperPodvLLMDPD推荐理由:AWS教你用vLLM在SageMaker HyperPod上把LLM推理分成两段跑,延迟更低,实操步骤写得挺清楚。原文稍后读已读值得跟进有用关注 SageMaker HyperPod
15:00AI Will@FinanceYF5AGI Summit SF 2026将于7月18-19日在旧金山艺术宫举行,预计15000人参与,200多位嘉宾演讲。Codex产品负责人、DeepSeek-R1复现第一人、Greptile CEO和vLLM作者将在同一舞台分享经验。这些演讲聚焦AI编程、模型复现和推理加速,对开发者有直接参考价值。行业CodexDeepSeek-R1Greptile推荐理由:把Codex、DeepSeek-R1、vLLM的大佬凑一起了,做AI编程和推理的别错过,比刷推特干货多。原文稍后读已读值得跟进有用关注 Codex
04:53官方账号vLLM@vllm_project精选vLLM项目与Inferact合作,在Ray Summit(8月24-26日于旧金山)举办首届vLLM Conference。会议将讨论vLLM路线图、如何最大化NVIDIA/AMD/TPU等加速器性能、将vLLM集成到训练与推理管线、以及生产级推理经验。演讲嘉宾来自Inferact、NVIDIA、AMD、Google TPU、Anyscale、PyTorch、Meta、Red Hat等。行业vLLMInferactRay Summit10 个信源在谈事件专题推荐理由:vLLM社区第一次线下大会,想了解高性能推理前沿和开源生态的朋友别错过,直接和NVIDIA、AMD、Google TPU的工程师面对面。原文稍后读已读值得跟进有用关注 vLLM
19:22官方账号vLLM@vllm_project精选MosiAI 发布了 MOSS-Transcribe-Diarize-0.9B,一个 0.9B 参数的开源端到端模型,专门用于多说话人长音频转录。该模型将 ASR、说话人日记化和时间戳对齐整合为单个生成式过程,不同于 WhisperX 的分阶段串联方式。它支持最长约 90 分钟的音频一次性输入,无需分块或拼接,并具备关键词偏置功能以提升专有名词识别准确率。vLLM 在发布当天(day-0)即提供了对该模型的支持。AI模型MOSS-Transcribe-Diarize-0.9BMosiAIvLLM1 个信源在谈事件专题推荐理由:MosiAI 新发的 0.9B 开源模型,一次性搞定多人对话的转录、打标签和加时间戳,90 分钟音频都不用分块,还支持关键词纠偏,赶紧试试。原文稍后读已读值得跟进有用关注 MOSS-Transcribe-Diarize-0.9B
19:20官方账号vLLM@vllm_project精选76°vLLM与Hugging Face团队在v0.25.0中实现了Transformers建模后端与手写vLLM模型的对等性能。现在450多种Transformers架构可以直接在vLLM中以原生速度运行,完全无需移植代码。用户只需集成一次Transformers即可自动获得vLLM的融合内核、torch.compile和CUDA图优化。这一更新大幅降低了在vLLM上使用新模型的工程成本。AI产品vLLMHugging FaceTransformers推荐理由:vLLM和Hugging Face搞了个大活:Transformers v0.25.0直接兼容vLLM,450多个模型自动加速,不用自己写适配代码了,开箱即用!原文稍后读已读值得跟进有用关注 vLLM
22:16Hunyuan@TXhunyuan腾讯混元Hy3模型获得vLLM项目支持。用户可以通过vLLM推理引擎启动Hy3进行体验。vLLM是一个高效的大模型推理框架,此次集成简化了Hy3的部署流程。AI模型Hy3TencentHunyuanvLLM推荐理由:腾讯混元让Hy3在vLLM上跑起来了,现在就能上手试玩,搞视频生成的朋友可以看看。原文稍后读已读值得跟进有用关注 Hy3
13:03官方一手arXiv: OpenAI@Sukanta GangulyPLACEMEM将智能体记忆表示为带版本号的胶囊,统一语义、来源、有效性和可重用运行时状态。原型基于vLLM,支持提示级文本检索、KV导向路由和级联失效。通过OpenAI兼容的侧车和类型化元数据契约,测量了首次token延迟、复用率和校正后行为。论文提出了面向终身智能体系统的重放感知服务集成路线图。论文PLACEMEM论文终身智能体4 个信源在谈事件专题推荐理由:这篇论文提出了PLACEMEM,用版本化胶囊解决终身智能体的记忆管理问题,原型跑在vLLM上,实测了延迟和复用率,适合研究记忆架构的读者。原文稍后读已读值得跟进有用关注 PLACEMEM
11:48官方一手arXiv: DeepSeek@Xiao Shi, Yingying Sun, Jiangsu Du, Zhiguang Chen, Yutong LuCAP框架通过协同激活驱动的专家放置减少跨设备通信,并引入通信感知剪枝选择性移除路由目标。在单节点和多节点实验中,相比DeepSeek EPLB和vLLM的序列放置,吞吐量提升1.23倍至1.86倍。该方法在达到相同加速目标时能保持更好的模型准确率。论文CAPMoEDeepSeek EPLB推荐理由:这篇论文提出CAP,直接在专家放置和剪枝中考虑通信开销,实测比DeepSeek EPLB快1.2-1.8倍,适合跑大MoE模型的人。原文稍后读已读值得跟进有用关注 CAP
01:59官方账号vLLM@vllm_project精选腾讯混元发布Hy3模型,作为Hy3 Preview的完整版,总参数295B,活跃参数仅21B,采用192专家MoE架构与top-8路由。该模型在vLLM从第一天起即原生支持,包含工具调用、推理解析器和MTP推测解码功能。上下文窗口达256K,配备3.8B MTP推测解码层,提供BF16和FP8权重。模型采用Apache 2.0许可证,已在NVIDIA和AMD硬件上验证。AI模型Hy3vLLM腾讯混元8 个信源在谈事件专题推荐理由:腾讯混元的Hy3,295B参数但只激活21B,vLLM第一天就支持,能跑工具和长推理,Apache 2.0随便使,值得一试!原文稍后读已读值得跟进有用关注 Hy3
01:54官方账号vLLM@vllm_project76°MistralAI 推出了 Leanstral 1.5,一个基于 Apache-2.0 许可证的 Lean 4 证明智能体。该模型采用 MoE 架构,总参数量 119B,仅激活 6B 参数。它在 miniF2F 上获得 100% 准确率,在 FATE-H 和 FATE-X 上分别达到 87% 和 34% 的新 SOTA。在 PutnamBench 上,它解决了 587/672 个问题,每问题成本约 4 美元。现在可通过 vLLM 进行部署。AI模型MistralAILeanstral 1.5vLLM推荐理由:MistralAI 的 Leanstral 1.5 用 6B 活跃参数就拿下 miniF2F 满分,每个问题才 4 美元,做数学证明的可以试试。原文稍后读已读值得跟进有用关注 MistralAI
15:45官方账号vLLM@vllm_project74°Qwen3-Omni采用多模态Thinker与Talker(Code2Wav)流水线架构。高并发下仅复制语音阶段,复用Thinker结果,首音频延迟从约6秒降至0.6秒。吞吐量在同GPU上提升5.4倍,语音生成快于实时。该优化由阿里、蚂蚁集团SCT团队和vLLM-Omni团队共同实现。AI模型Qwen3-Omni多模态推理优化推荐理由:阿里和蚂蚁团队搞了个优化,Qwen3-Omni实时对话延迟从6秒降到0.6秒,吞吐还翻了5倍多,推荐看技术博客。原文稍后读已读值得跟进有用关注 Qwen3-Omni
09:48官方一手arXiv: DeepSeek@Shrikara Arun, Anjaly Parayil, Srikant Bharadwaj, Renee St. Amant, Victor Rühle精选该论文针对分离式LLM服务中预填充节点过载而解码节点空闲的问题,提出了一种主动预填充偏转调度器。在2个预填充节点和2个解码节点的A100集群上,预填充执行仅占P95首次令牌延迟的2-23%,其余为排队和KV-cache传输。该调度器让解码节点以分块预填充步骤穿插解码批次的方式处理请求,消除节点间KV传输。基于vLLM和DeepSeek-V2-Lite的实验显示,相比最优分离式调度器,P95 TTFT降低81%,SLO达成率提升79%。论文Disaggregated LLM servingprefill deflectionvLLM推荐理由:这篇论文讲了个很实在的优化:让空闲的解码节点分担预填充活儿,不用等KV传输,TTFT降了81%原文稍后读已读值得跟进有用关注 Disaggregated LLM serving