主要来源vLLM
查看原文事件专题 ·多源确认
vLLM 上 GLM-5.3 单用户解码达 469 tok/s
TileRT 和 AMD 团队在 SemiAnalysis_ 的 AgentX 环境中,用 8 张 MI355X 跑 vLLM,将 GLM-5.3 的单用户解码速度做到 469 tok/s。该部署采用分离式架构:vLLM 负责预填充(prefill),TileRT 通过 vLLM 的 V1 connector 接口处理对延迟敏感的解码(decode)阶段。
当前结论
AMD 显卡跑 GLM-5.3 冲到 469 tok/s 单用户解码,vLLM 管预填、TileRT 管解码的拆分架构值得部署党细看。
3 个信源58° AI 热度最后更新 2026/9/25 01:36:59
证据链
3 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。