行业多源确认13:52Chamath 解释推理两阶段:prefill 吃算力,decode 吃显存带宽Chamath 用两句话讲清了推理时 prefill 和 decode 的区别,想搞懂为什么 Nvidia 在长上下文里占优的可以看看。#Nvidia#prefill#decode#推理优化3 个信源在谈事件专题rohanpaul_ai@rohanpaul_ai4 个信源在谈原文稍后读已读值得跟进有用关注 Nvidia