主要来源shao__meng
查看原文事件专题 ·单一信源
Cohere 开源 Megakernel 推理系统
Cohere 为 North Mini Code 模型构建了基于 decode megakernel 的推理服务系统。在单张 H100 上,batch size 1 时达到 292 tok/s,比 vLLM 快 1.58 倍。该系统利用 H100 显存带宽理论值的 62%,端到端服务在真实基准上快 1.25-1.41 倍。
当前结论
Cohere 开源了比 vLLM 快 1.58 倍的 Megakernel 推理系统,解决了传统引擎在算子边界处的 GPU 空转问题。
2 个信源78° AI 热度最后更新 2026/9/8 23:28:19
证据链
2 个信源相关来源 1Cohere
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。