论文多源确认精选10:43FlashBoot:亚秒级大模型权重加载系统SGLang团队搞的FlashBoot,把大模型权重加载从20秒压到0.4秒,跨节点复制只要10毫秒。跑DeepSeek-V4系列,NVL72上实测数据,做弹性部署的值得看。#FlashBoot#SGLang#DeepSeek-V4#权重加载8 个信源在谈事件专题aarXiv: DeepSeek@Issac Zhu 等 6 人9 个信源在谈原文稍后读已读值得跟进有用关注 FlashBoot
产品精选04:20Runpod推出AI模型Serverless方案,冷启动低于200msRunpod让部署大模型像serverless函数一样快,冷启动200ms,成本降90%,不用再纠结闲置GPU还是等待加载了。#Runpod#FlashBoot#Serverless#GPU部署Ate-a-Pi@svpino原文稍后读已读值得跟进有用关注 Runpod