10:18官方账号arXiv cs.AI@Tate Berenbaum, Muthaiah VenkatachalamIntel AI PC集群通过管道分片技术,将Llama 3.1 8B参数模型拆分为预编译分片,实现分布式推理;采用INT4量化后,两节点部署下同时服务两个用户,吞吐量达到单机未拆分模型的1.79倍;四节点部署可支持70B参数模型推理,单用户交互速度流畅且与全节点解码效果一致。AI模型Llama 3.1Intel AI PC大模型推荐理由:Intel推出了在AI PC集群上实现大规模LLM分布式推理的片方法,能让集群共同计算超单台容量的模型,和单机相比效率更高。原文稍后读已读值得跟进有用关注 Llama 3.1