事件专题 ·单一信源

Cohere 开源 Megakernel 推理系统

Cohere 为 North Mini Code 模型构建了基于 decode megakernel 的推理服务系统。在单张 H100 上,batch size 1 时达到 292 tok/s,比 vLLM 快 1.58 倍。该系统利用 H100 显存带宽理论值的 62%,端到端服务在真实基准上快 1.25-1.41 倍。

当前结论

Cohere 开源了比 vLLM 快 1.58 倍的 Megakernel 推理系统,解决了传统引擎在算子边界处的 GPU 空转问题。

2 个信源78° AI 热度最后更新 2026/9/8 23:28:19

证据链

2 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。