模型多源确认76°07:20Kog@AI 实现 3000 tokens/s 推理速度,8×AMD MI300X 跑 2B 模型Kog@AI 把推理速度从 300 拉到 3000 tokens/s,做模型部署和推理优化的团队值得研究他们的内存流方法,直接看原文能学到如何消除 GPU 瓶颈。#推理优化#AMD MI300X#NVIDIA H200#内存流7 个信源在谈事件专题rohanpaul_ai@rohanpaul_ai8 个信源在谈原文稍后读已读值得跟进有用关注 推理优化