10:18官方账号arXiv cs.AI@Tate Berenbaum, Muthaiah VenkatachalamIntel AI PC集群通过管道分片技术,将Llama 3.1 8B参数模型拆分为预编译分片,实现分布式推理;采用INT4量化后,两节点部署下同时服务两个用户,吞吐量达到单机未拆分模型的1.79倍;四节点部署可支持70B参数模型推理,单用户交互速度流畅且与全节点解码效果一致。AI模型Llama 3.1Intel AI PC大模型推荐理由:Intel推出了在AI PC集群上实现大规模LLM分布式推理的片方法,能让集群共同计算超单台容量的模型,和单机相比效率更高。原文稍后读已读值得跟进有用关注 Llama 3.1
12:23官方账号arXiv cs.AI@Jhonatan Tavori, Gur-Eyal Sela, Ion Stoica, Gil Zussman该论文揭示了一种新的攻击面:在结合快速路径与高精度慢速路径的分布式推理流水线中,协调层容易受到波形负载攻击(如Yo-Yo bursts)影响。攻击者通过约4000个突发请求可将正常用户的p99延迟从92ms推至2秒,几乎消除慢路径的云端推理优势,使多目标跟踪质量平均下降7.0 HOTA点。不同攻击时段造成2.0-18.7 HOTA点的差异,稀有类别(如停车标志)的预测精度损失近半。研究证明了无需访问模型权重或数据即可通过负载攻击降级预测质量。论文分布式推理AI安全HOTA推荐理由:这篇论文揭示了分布式推理系统的新安全漏洞:只用网络流量攻击就能让自动驾驶跟踪精度暴跌18.7 HOTA点。搞推理部署的人一定要看看。原文稍后读已读值得跟进有用关注 分布式推理
00:37官方一手marktechpost@Sana Hassan本文介绍NVIDIA srt-slurm框架,使用srtctl将YAML声明式配置转换为可重复的SLURM基准工作流。在Google Colab中配置集群并运行内置与自定义配方。通过参数扫描和Pareto分析,建模分离预填充(prefill)和解码(decode)部署的性能权衡。技巧NVIDIAsrt-slurmSLURM3 个信源在谈事件专题推荐理由:想搞分布式LLM基准测试?NVIDIA这个srt-slurm框架让你用YAML写配置,一键跑SLURM,还能做参数扫描和Pareto分析,超实用。原文稍后读已读值得跟进有用关注 NVIDIA
09:48官方账号arXiv cs.LG@Xin Yuan, Ning Li, Quan Chen, Wenchao Xu, Athanasios V. Vasilakos, Song Guo, Haijun ZhangOrderMoE提出了一种利用专家相似性的分布式部署框架,专为资源受限的边缘基础设施设计。它通过路由器诱导的logits表示构建专家相似性模型,将MoE层中的专家分组到多个相似性组中。然后采用相似性感知的专家分组与部署策略,提高边缘服务器间的本地相似性覆盖率。在真实边缘测试平台上,OrderMoE显著降低了平均延迟、尾延迟、跨服务器流量和远程专家调用比例,且推理质量下降可控。论文OrderMoEMoE边缘计算推荐理由:这篇论文把MoE模型卸到边缘设备上跑,靠专家相似性分组减少跨服务器通信,实测延迟和流量都降了,质量只掉一点。原文稍后读已读值得跟进有用关注 OrderMoE
02:07Fireworks AI@FireworksAI_HQ精选Cognition团队分享了其生产级强化学习训练基础设施的设计,核心将训练分为两部分:紧耦合通信的trainer和分布式异步rollout推理。他们的RL训练横跨三大洲四个数据中心,结合自有GPU集群和Fireworks AI等推理提供商的算力。rollout推理引擎通过压缩权重差异在对象存储中同步,实现分布式扩展。这套基础设施支撑了SWE-1.7模型的训练,并确保跨数据中心的可靠rollout。行业CognitionSWE-1.7Fireworks AI3 个信源在谈事件专题推荐理由:Cognition分享了他们怎么跨三大洲四个数据中心做RL训练,用紧耦合trainer加分布式异步推理,还靠压缩权重差异同步,做到稳定rollout。做大规模RL的值得看看。原文稍后读已读值得跟进有用关注 Cognition
20:45官方账号NVIDIA AI@NVIDIAAINVIDIA 宣布与 Gcore 和 Orange Business 合作,基于 NVIDIA Dynamo 平台实现大规模分布式 AI 推理。该方案旨在解决高并发推理场景下的延迟和成本问题,通过分布式架构优化 GPU 利用率。合作方将共同为企业客户提供可扩展的推理基础设施,支持大模型在生产环境中的高效部署。此举标志着 NVIDIA 在 AI 推理领域从硬件向平台化生态的进一步延伸。AI产品NVIDIA Dynamo分布式推理Gcore9 个信源在谈事件专题推荐理由:分布式推理是当前大模型落地的关键瓶颈,NVIDIA 联合云服务商推出规模化方案,做 AI 部署和 MLOps 的团队值得关注,尤其是需要处理高并发推理的企业。原文稍后读已读值得跟进有用关注 NVIDIA Dynamo
09:41官方账号arXiv cs.AI@Zhiyao Xu, Aoxue Liu, Zhanjie Ding, Dan Zhao, Yong Jiang, Qing Li稀疏激活的混合专家(MoE)模型在分布式推理中面临跨GPU通信和负载不均问题。现有方法通过全局路由痕迹平均化处理专家共激活模式,忽略了多任务场景下不同任务族的异质性。本文提出TACG框架,利用任务族特定的调度和共激活痕迹,为每个专家推导任务族偏好,重新加权共激活图,使同族专家优先部署在同一GPU上。同时引入GESR机制,复制通用专家到少量辅助GPU,在线推理时兼顾局部性和负载均衡。在三个开源MoE模型上,该方法平均降低通信成本31.39%,Jain公平指数达0.9975,且对推理数据分布偏移具有鲁棒性。论文MoE模型分布式推理通信优化推荐理由:MoE推理的通信瓶颈终于有了任务感知的解法——做多任务MoE部署的团队可以直接参考TACG的静态分组+GESR动态复制策略,实测通信成本降三成,公平性几乎无损。原文稍后读已读值得跟进有用关注 MoE模型