11:57官方账号arXiv cs.LG@Krish Agarwal, Zhuoming Chen, Yanyuan Qin, Zhenyu Gu, Atri Rudra, Beidi ChenFlashRT 是一个引导编码智能体优化实时多模态应用部署的框架,将简单参考实现转化为多 GPU 部署。在 NVIDIA B200 GPU 上,FlashRT 将视频世界模型和多模态 LLM 的延迟降低达 70 倍,吞吐量提升 2.8 倍。在 AMD MI355X GPU 上,延迟降低持平,吞吐量提升达 3.6 倍。针对 Qwen3-Omni 文本到音频推理,FlashRT 在 AMD MI355X 上比专家 vLLM-Omni 实现减少 65% 响应延迟。AI模型FlashRTNVIDIAAMD7 个信源在谈事件专题推荐理由:部署多模态模型时延迟高吞吐低?FlashRT 让智能体自动优化,实测延时降 70 倍,吞吐升 3.6 倍,AMD 平台效果尤其猛。原文稍后读已读值得跟进有用关注 FlashRT
11:42官方账号arXiv cs.LG@Liang Su论文提出execution-state capsules,一种图绑定的检查点与恢复机制,能保存KV缓存、循环状态、卷积状态等完整执行状态。基于此实现的FlashRT运行时在RTX 5090上,恢复操作亚毫秒级,TTFT相比冷预填充在2k tokens时加速3.9倍,16k tokens时加速27倍。在Jetson AGX Thor和DGX Spark上保持相同正确性和结构特性。该方法不取代高吞吐KV缓存服务,而是为显式执行状态复用提供互补的低延迟方案。论文Execution-State CapsulesFlashRT设备端AI推荐理由:FlashRT用执行状态胶囊实现了亚毫秒级恢复,比传统KV缓存多保存循环状态,对交互式AI和机器人很关键。原文稍后读已读值得跟进有用关注 Execution-State Capsules