智谱发布GLM-5.3-FlashX,推理速度达200 tokens/s
Zhipu Opens GLM-5.3-FlashX Near 200 Tokens/s on ~100k Domestic Accelerators
智谱AI新出的GLM-5.3-FlashX模型,在国产加速器上跑得特别快,每秒能处理200个token,比之前版本效率高不少。
智谱AI推出的GLM-5.3-FlashX模型,在约10万颗国产加速器上实现每秒200个token的推理速度。该模型基于320亿参数的混合专家(MoE)架构,并使用基础设施代理优化了服务堆栈。
Zhipu Opens GLM-5.3-FlashX Near 200 Tokens/s on ~100k Domestic Accelerators
Zhipu AI launched GLM-5.3-FlashX with claimed ~200 tok/s inference on ~100,000 domestic accelerators; Flash base is a 320B MoE/18B active open model, with an Infra Agent optimizing the serving stack.