8月20日
10:18
10:18官方账号arXiv cs.AI@Tate Berenbaum, Muthaiah Venkatachalam
Intel AI PC集群通过管道分片技术,将Llama 3.1 8B参数模型拆分为预编译分片,实现分布式推理;采用INT4量化后,两节点部署下同时服务两个用户,吞吐量达到单机未拆分模型的1.79倍;四节点部署可支持70B参数模型推理,单用户交互速度流畅且与全节点解码效果一致。
推荐理由:Intel推出了在AI PC集群上实现大规模LLM分布式推理的片方法,能让集群共同计算超单台容量的模型,和单机相比效率更高。