事件专题 ·单一信源

NVIDIA 官方 LLM 推理基准指标定义,把 LLM 推理的每个指标概念都搞清楚!

NVIDIA NIM LLMs Benchmarking 2.0.0 核心是围绕 prefill/decode 两阶段执行模型构建的一套指标体系。文档定义了 TTFT(首 token 延迟)从提交请求到收到第一个输出 token 的时间,包含排队时间 + prefill 计算 + 网络延迟。e2e Request Latency 是 TTFT + Generation_time,包含排队、批处理调度、网络在内的全部时间。ITL / TPOT 是 token 间延迟,AIPerf 公式为 (e2e_latency - TTFT) / (output_tokens - 1),反映解码阶段的速度。TPS 是出 token 吞吐,系统级 TPS = Total_output_tokens / (Ty - Tx),是所有并发请求的总输出吞吐。RPS 是单位时间成功完成的请求数,与 TPS 的区别在于计的是“请求条数”而非“token 个数”。

当前结论

NVIDIA 官方出了一套 LLM 推理指标体系,把 prefill 和 decode 阶段的延迟、吞吐等概念讲得特别清楚,对选型或容量规划很有帮助。

2 个信源78° AI 热度最后更新 2026/9/13 11:49:12

证据链

2 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。