7月21日
11:57
11:57官方账号arXiv cs.LG@Krish Agarwal, Zhuoming Chen, Yanyuan Qin, Zhenyu Gu, Atri Rudra, Beidi Chen
FlashRT 是一个引导编码智能体优化实时多模态应用部署的框架,将简单参考实现转化为多 GPU 部署。在 NVIDIA B200 GPU 上,FlashRT 将视频世界模型和多模态 LLM 的延迟降低达 70 倍,吞吐量提升 2.8 倍。在 AMD MI355X GPU 上,延迟降低持平,吞吐量提升达 3.6 倍。针对 Qwen3-Omni 文本到音频推理,FlashRT 在 AMD MI355X 上比专家 vLLM-Omni 实现减少 65% 响应延迟。
事件专题

推荐理由:部署多模态模型时延迟高吞吐低?FlashRT 让智能体自动优化,实测延时降 70 倍,吞吐升 3.6 倍,AMD 平台效果尤其猛。