主要来源vLLM
查看原文事件专题 ·多源确认
inferact 开源 Kimi K3 TPU megakernel,单核跑出 709 tokens/s
inferact 团队为 Kimi K3 开源了一个 TPU megakernel,推理速度达到 709 tokens/s,高于 GB200 上的 450 tokens/s。K3 全部 92 个 MoE 层都在单个 Pallas kernel 中运行。该实现采用跨层边界的权重预取,让一层的权重传输与上一层的计算重叠进行。代码仓库和详细写文已发布。
当前结论
Kimi K3 在 TPU 上跑到 709 tokens/s,比 GB200 还快,92 个 MoE 层塞进一个 Pallas kernel,做法挺巧,做推理的可以看看。
7 个信源58° AI 热度最后更新 2026/9/23 18:20:22
证据链
7 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。