论文精选09:48Load-aware prefill deflection reduces P95 TTFT by 81% in disaggregated LLM serving这篇论文讲了个很实在的优化:让空闲的解码节点分担预填充活儿,不用等KV传输,TTFT降了81%#Disaggregated LLM serving#prefill deflection#vLLM#DeepSeek-V2-LiteaarXiv: DeepSeek@Shrikara Arun 等 5 人原文稍后读已读值得跟进有用关注 Disaggregated LLM serving