02:16官方账号Microsoft Research@MSFTResearchMicrosoft将参加SIGCOMM 2026大会,介绍其在网络流量工程方向的新进展。大会内容还包括新的负载均衡策略、自适应光子交换调度和AI网络模拟。这些研究聚焦大规模网络性能优化,具体细节需查看官方页面。论文MicrosoftSIGCOMM网络流量工程推荐理由:微软要在SIGCOMM上晒网络研究,有负载均衡新招和AI模拟网络,搞网络的快去看看。原文稍后读已读值得跟进有用关注 Microsoft
12:29官方一手arXiv: DeepSeek@Jie Li, Chenxin Jia, Jinliang Shen, Cunzhuang Liu, Ruiyi Ding, Jianwen Xian, Kang He, Chengru Song论文在专家并行MoE服务中发现,GPU吞吐量并不由token数或激活专家数单独决定:约156-168 token以下是显存权重流主导,以上则按128-tile对M维度取整。据此提出TEMPO调度器,将每批调度建模为固定费用makespan问题,在毫秒级求解;在8卡Testbed A上,相对最优固定基线最多提升15.5%,其余场景差距在1%以内。端到端测试中,Qwen3-235B吞吐提升4-6%、p99延迟降低约15.6%,DeepSeek-V3则未见收益。TEMPO论文强调这是阶段图预测的结果,并非普适胜利。论文TEMPOMoE专家并行推荐理由:如果你在做MoE推理,TEMPO这个调度器在内存/算力瓶颈混合时能比常规方案快15.5%;不过DeepSeek-V3那种通信瓶颈场景它不灵。原文稍后读已读值得跟进有用关注 TEMPO
18:14小互@imxiaohu精选Anthropic 发布全新 MCP 规范,移除了原有的初始化握手和会话 ID。新规范下,每个请求自带身份信息,任何服务器都可独立处理,无需绑定单一机器。这意味着 MCP 服务器可以像普通 Web 服务一样通过负载均衡器水平扩展,也支持 serverless 部署。此前 MCP 服务器必须保持客户端和服务器间长连接,无法弹性伸缩。AI模型MCPAnthropic云部署10 个信源在谈事件专题推荐理由:Anthropic 更新了 MCP 协议,去掉了会话绑定,现在 MCP 服务器能上云水平扩展了,serverless 也能跑,做工具链的可以试。原文稍后读已读值得跟进有用关注 MCP
11:05idoubi@idoubicc72°MCP 协议推出第五个大版本(2026-07-28),核心将从有状态双向协议变为无状态请求/响应协议,每个请求自带版本和客户端信息,可负载均衡到多个实例,支持 serverless 和 CDN 部署。新增 MRTR(多轮往返请求)机制,允许服务端中途要求用户确认,如 Supabase 在项目创建前展示费用。请求头新增 Mcp-Method 和 Mcp-Name 字段,防火墙可据此路由而无需解析 JSON。废弃 Roots、Sampling、Logging 及旧版 HTTP+SSE,提供至少 12 个月过渡期。AWS 的 Bedrock AgentCore、Microsoft Foundry、Cloudflare Workers、Google Cloud 等已宣布支持新规范。AI模型MCP无状态负载均衡推荐理由:MCP 终于去掉会话 ID 了,部署起来像普通 HTTP 一样灵活。还有 MRTR 解决中途确认问题,很实用。如果你在生产环境用 MCP,得仔细看迁移指南。原文稍后读已读值得跟进有用关注 MCP
21:13官方账号LMSYS Org (SGLang)@lmsysorg71°SGLang团队为DeepEP MoE引入两种调度时负载均衡器Waterfill和LPLB。Waterfill将共享专家工作分配到较轻的rank,在DeepSeek V3/R1上带来+1.48%到+4.66%的性能提升,V4 Flash吞吐量从49,253 tok/s增至51,677 tok/s。LPLB优化冗余路由专家副本的流量分配,在red16/red32配置下取得+0.84%到+7.34%的提升。两种方法均不改变模型语义,保持推理精度。AI产品SGLangDeepEPDeepSeek V3推荐理由:SGLang给DeepSeek模型加了两个新负载均衡器,跑DeepSeek V3/R1速度能快最多7%,而且不改精度,想加速推理的可以试试。原文稍后读已读值得跟进有用关注 SGLang
09:41官方账号arXiv cs.AI@Zhiyao Xu, Aoxue Liu, Zhanjie Ding, Dan Zhao, Yong Jiang, Qing Li稀疏激活的混合专家(MoE)模型在分布式推理中面临跨GPU通信和负载不均问题。现有方法通过全局路由痕迹平均化处理专家共激活模式,忽略了多任务场景下不同任务族的异质性。本文提出TACG框架,利用任务族特定的调度和共激活痕迹,为每个专家推导任务族偏好,重新加权共激活图,使同族专家优先部署在同一GPU上。同时引入GESR机制,复制通用专家到少量辅助GPU,在线推理时兼顾局部性和负载均衡。在三个开源MoE模型上,该方法平均降低通信成本31.39%,Jain公平指数达0.9975,且对推理数据分布偏移具有鲁棒性。论文MoE模型分布式推理通信优化推荐理由:MoE推理的通信瓶颈终于有了任务感知的解法——做多任务MoE部署的团队可以直接参考TACG的静态分组+GESR动态复制策略,实测通信成本降三成,公平性几乎无损。原文稍后读已读值得跟进有用关注 MoE模型
23:35berryxia@berryxia精选73°Daily Dose of Data Science 通过视觉图解清晰对比了 Transformer 和 Mixture of Experts(MoE)的核心差异。MoE 将 Transformer 中的单个前馈网络拆分为多个小专家网络,推理时仅激活部分专家,虽参数更多但计算更快。模型通过 Router(多分类器)为每个 token 选择 top-K 专家,但训练中面临“专家过选”和“负载不均”两大问题。前者通过加噪声和屏蔽非 top-K logit 解决,后者通过设置专家容量上限并自动转交 token 来平衡。Mixtral 8x7B 和 Llama 4 是典型 MoE 模型。AI模型TransformerMoE路由机制推荐理由:想搞懂 MoE 为什么又快又强,这篇视觉解释把路由和负载均衡的坑讲透了,做模型训练或推理优化的开发者值得一看。原文稍后读已读值得跟进有用关注 Transformer
19:12官方账号arXiv cs.LG@Sagi Ahrac, Noya Hochwald, Mor Geva精选稀疏混合专家模型(SMoE)在扩展语言模型时面临路由崩溃和负载均衡损失导致专业化下降的问题。本文揭示了路由器与其对应专家之间的几何耦合机制:对于给定token,所选专家的路由器权重和专家权重沿相同输入方向接收梯度,仅标量系数不同,因此匹配的路由器-专家方向累积相同的路由历史。实验表明,从零训练的1B SMoE中,更高的路由器分数预测更强的专家神经元激活,路由决策在所选专家内部被镜像。辅助负载均衡损失会破坏这种几何结构,使不同路由器方向相似度增加近三倍。最后,作者提出无参数在线K-Means路由器,通过维护专家隐藏状态运行平均值并基于余弦相似度分配token,在最低负载不平衡和适度困惑度增加下验证了几何耦合对有效路由的核心作用。论文稀疏MoE路由机制几何耦合推荐理由:做MoE模型训练或路由优化的研究者,这篇论文解释了路由崩溃和负载均衡损失的底层机制,看完会对如何设计更有效的路由策略有直接启发。原文稍后读已读值得跟进有用关注 稀疏MoE