事件专题 ·官方一手

智谱发布GLM-5.3-FlashX,推理速度达200 tokens/s

智谱AI推出的GLM-5.3-FlashX模型,在约10万颗国产加速器上实现每秒200个token的推理速度。该模型基于320亿参数的混合专家(MoE)架构,并使用基础设施代理优化了服务堆栈。

当前结论

智谱AI新出的GLM-5.3-FlashX模型,在国产加速器上跑得特别快,每秒能处理200个token,比之前版本效率高不少。

6 个信源78° AI 热度最后更新 2026/9/18 07:51:45

证据链

6 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。