16:09官方一手Pandaily@contact@pandaily.com (Pandaily)精选小红书发布自研大模型dots3-note,MoE模型,总参数280B,激活参数16B,512K上下文,支持文本、视觉和语音理解。以Apache 2.0协议在Hugging Face和GitHub上开源,华为Ascend零延迟适配,标志着月活跃用户超3亿的平台上,AI从功能转变为基础。AI模型小红书大模型MoE模型推荐理由:小红书开源自研大模型,支持多模态理解,与华为Ascend深度适配,为内容平台构建AI基础,值得关注。原文稍后读已读值得跟进有用关注 小红书
05:45官方一手marktechpost@Asif Razzaq阿里Qwen团队预览了Qwen3.8-Max-Preview,该模型拥有2.4万亿参数,采用MoE架构,自称性能仅次于Fable 5。预览版已在Token Plan、Qoder和QoderWork上以标准定价的10%提供服务。官方未公布任何基准测试表格、模型卡或许可证,也未说明激活参数数量。读者需区分阿里的确认信息与声称内容。AI模型Qwen3.8-MaxAlibabaKimi K310 个信源在谈事件专题推荐理由:阿里放了个大招,Qwen3.8-Max有2.4万亿参数,号称仅次于Fable 5,但没给具体跑分,价格只要十分之一,值得关注。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
11:21阮一峰的网络日志(博客/媒体)精选RTX 5090有32GB显存和1792GB/s带宽,但无法加载70B参数模型(需32.6GB)。AMD Strix Halo迷你PC(Ryzen AI Max+ 395)拥有128GB统一内存和256GB/s带宽,能加载大模型但Token生成速度仅每秒6个。MoE模型如Qwen3-30B-A3B每次只激活3B参数,可将读取量降至2GB,从而在迷你PC上达到每秒100+ Token。选择硬件需根据模型大小和速度需求权衡。技巧RTX 5090AMD Strix Halo统一内存推荐理由:想在家跑AI大模型?这篇对比了RTX 5090和AMD迷你PC,解释了为什么统一内存能装大模型但速度慢,还教你用MoE模型提速。原文稍后读已读值得跟进有用关注 RTX 5090
09:08官方一手arXiv: DeepSeek@Wenxin Wang, Yule Hou, Yu Ji, Peng Qu, Youhui Zhang精选72°本地部署大型混合专家模型(MoE)在服务质量上远不及云端环境,即使低并发场景也存在四大差距:依赖降级模型、无法满足长预填充的30秒TTFT、解码吞吐量低于20 tokens/s、混合负载下并发能力差。本文提出CPU-GPU混合系统,通过流式加载预填充(SLP)将预填充吞吐提升至1200 tokens/s,支持32K提示词在30秒内完成;分布式SLP(DSLP)结合SmallEP专家并行,在双RTX 5090上达到1800 tokens/s和45K提示词;以及零拷贝共享权重的节点内预填充-解码分离、AVX-512优化的FP8 GEMV内核等技术。该系统在消费级CPU-GPU平台上实现了旗舰MoE模型的云级服务质量,无需数据中心基础设施即可获得高质量、低成本的本地推理。论文MoE模型CPU-GPU混合推理优化推荐理由:本地跑MoE大模型终于能追上云端的服务质量了——做本地部署的开发者可以直接参考这套CPU-GPU混合方案,不用再忍受降级模型和低吞吐。原文稍后读已读值得跟进有用关注 MoE模型
09:41官方账号arXiv cs.AI@Zhiyao Xu, Aoxue Liu, Zhanjie Ding, Dan Zhao, Yong Jiang, Qing Li稀疏激活的混合专家(MoE)模型在分布式推理中面临跨GPU通信和负载不均问题。现有方法通过全局路由痕迹平均化处理专家共激活模式,忽略了多任务场景下不同任务族的异质性。本文提出TACG框架,利用任务族特定的调度和共激活痕迹,为每个专家推导任务族偏好,重新加权共激活图,使同族专家优先部署在同一GPU上。同时引入GESR机制,复制通用专家到少量辅助GPU,在线推理时兼顾局部性和负载均衡。在三个开源MoE模型上,该方法平均降低通信成本31.39%,Jain公平指数达0.9975,且对推理数据分布偏移具有鲁棒性。论文MoE模型分布式推理通信优化推荐理由:MoE推理的通信瓶颈终于有了任务感知的解法——做多任务MoE部署的团队可以直接参考TACG的静态分组+GESR动态复制策略,实测通信成本降三成,公平性几乎无损。原文稍后读已读值得跟进有用关注 MoE模型
12:13官方一手arXiv: DeepSeek@Xiongwei Zhu, Xiaojian Liao, Tianyang Jiang, Yusen Zhang, Liang Wang, Limin Xiao精选细粒度混合专家(MoE)模型在推理时只激活部分专家,但内存受限场景下只能缓存少量专家,未缓存的专家需从慢速外部存储获取,导致频繁换入换出和I/O开销。ReMoE提出一种路由器微调框架,通过偏向近期选中的专家来产生时间上稳定的路由,从而提升专家复用率,减少存储访问。实验表明,在DeepSeek和Qwen模型上,ReMoE将专家复用率提升26%,同时保持下游任务性能。在vLLM GPU-CPU专家卸载场景下,输出吞吐量提升8.4%;在Jetson Orin NX上使用llama.cpp时,TPOT降低43.6-49.8%,解码速度提升1.77-1.99倍。代码和模型已开源。论文MoE模型推理优化路由器微调推荐理由:ReMoE解决了内存受限设备上MoE模型推理的I/O瓶颈,做边缘部署或大模型推理优化的开发者可以直接试,开源代码让复现门槛很低。原文稍后读已读值得跟进有用关注 MoE模型
11:22官方账号arXiv cs.LG@Hongwu Peng, Ohiremen Dibua, Yuanjun Xiong, Yifan Gong, Jianming Zhang, Yan Kang精选研究者提出Complete-muE框架,解决了从密集FFN到混合专家(MoE)模型架构的超参数迁移问题。现有方法如μP和SDE无法处理MoE中专家数量变化带来的架构和每个专家token数同时改变的问题。Complete-muE通过双桥系统实现迁移:桥I利用激活宽度μP和归一化路由器尺度映射密集FFN到密集MoE;桥II通过激活专家缩放映射密集MoE到稀疏MoE,并处理一阶SDE学习率/权重衰减校正。实验表明,在语言模型和扩散模型预训练中,该框架能使超参数在多种MoE配置下保持稳定,实现“一次调参,迁移所有”的效果,显著加速MoE模型收敛。论文MoE模型超参数迁移缩放法则推荐理由:做大规模MoE模型训练的团队终于有了可靠的超参数迁移方案——不用为每个专家配置重新调参,直接复用密集模型的超参数即可,建议做预训练优化的点开看看。原文稍后读已读值得跟进有用关注 MoE模型