事件专题 ·多源确认

vLLM 上 GLM-5.3 单用户解码达 469 tok/s

TileRT 和 AMD 团队在 SemiAnalysis_ 的 AgentX 环境中,用 8 张 MI355X 跑 vLLM,将 GLM-5.3 的单用户解码速度做到 469 tok/s。该部署采用分离式架构:vLLM 负责预填充(prefill),TileRT 通过 vLLM 的 V1 connector 接口处理对延迟敏感的解码(decode)阶段。

当前结论

AMD 显卡跑 GLM-5.3 冲到 469 tok/s 单用户解码,vLLM 管预填、TileRT 管解码的拆分架构值得部署党细看。

3 个信源58° AI 热度最后更新 2026/9/25 01:36:59

证据链

3 个信源
相关来源 1Artificial Analysis
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。