事件专题 ·多源确认

EAServe 论文提出面向多模态 LLM 的 Encode 感知分离式推理服务

论文针对多模态大模型(MLLM)推理中新增的 Encode 阶段提出 EAServe 系统,将 Encode-Prefill-Decode 三阶段流水线中的 Encode 重新定位为控制点。其运行时层包含负载自适应微批处理、速率控制的 partially offload 和动态 SM 分区,配置层 HAS 通过按阶段容量画像和 TPE 贝叶斯优化搜索 GPU 分配、encode 批大小与 offload 比例。在覆盖图像、视频、音频的三种 MLLM 架构上评测,相同 SLO 约束下 EAServe 的 goodput 分别比 NVIDIA Dynamo 高 4.3 倍、比 vLLM 高 1.7 倍,并显著提升 GPU 利用均衡度。

当前结论

一篇推理系统论文,解决多模态模型 Encode 阶段拖垮 GPU 利用率的问题,goodput 比 vLLM 高 1.7 倍、比 NVIDIA Dynamo 高 4.3 倍,做 MLLM 服务的可以看看。

6 个信源58° AI 热度最后更新 2026/9/25 17:20:22

证据链

6 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。