模型多源确认83°01:29Kog AI 实现 3000 tokens/s 推理速度,10-30 倍提升Kog AI 把 GPU 推理的隐藏效率瓶颈挖出来了,做 LLM 推理优化的开发者可以直接关注他们的技术预览,看看 monokernel 和延迟张量并行能否复现到自己的模型上。#推理优化#GPU#Kog AI#AMD MI300X5 个信源在谈事件专题rohanpaul_ai@rohanpaul_ai6 个信源在谈原文稍后读已读值得跟进有用关注 推理优化+1