Google 论文:Serverless CPU 上量化 LLM 冷启动 55-70% 延迟来自模型加载
Google 这篇论文拆了 serverless CPU 跑量化小模型的延迟构成,55-70% 耗在加载权重,加内存到 8 GB 就能让推理快近一倍,部署前值得看。
Google 这篇论文拆了 serverless CPU 跑量化小模型的延迟构成,55-70% 耗在加载权重,加内存到 8 GB 就能让推理快近一倍,部署前值得看。
Anthropic 更新了 MCP 协议,去掉了会话绑定,现在 MCP 服务器能上云水平扩展了,serverless 也能跑,做工具链的可以试。