论文精选11:25PALS:面向MoE模型的功耗感知LLM服务系统数据中心GPU能耗是AI部署的隐形杀手,PALS把功耗从硬约束变成可调参数,做LLM服务部署的团队可以直接在vLLM上集成,省电又保性能,值得一试。#LLM推理#功耗优化#混合专家模型#vLLMaarXiv cs.AI@Can Hankendi 等 4 人原文稍后读已读值得跟进有用关注 LLM推理