#MoE
DeepInfra上线了Qwen最新稀疏MoE模型,2.4T总参数只激活95B,专攻编程和智能体场景,价格也公布了,想试API的可以直接上手。
如果你在做MoE推理,TEMPO这个调度器在内存/算力瓶颈混合时能比常规方案快15.5%;不过DeepSeek-V3那种通信瓶颈场景它不灵。
微信出了 WeLM,80B 和 617B 两个版本,主打省资源,激活参数只有 3B 和 23B。想省算力可以看看。
想做智能体又怕模型太贵太慢?Nemotron 3.5 Lightning只有3B活跃参数,在Fireworks上直接就能调。
Fireworks 上线了 Qwen3.8-2.4T-A95B,2.4T 参数 MoE,主打智能体和写代码,有 Day-0 支持,直接就能用。
NVIDIA 的 Nemotron 3.5 Lightning 微调后,在 6 项任务上超过 4 个同类 MoE 模型拿了第一。想知道怎么调出来的,可以看这篇。
NVIDIA 把 30B MoE 的 Lightning 放到 Perplexity API 上了,每百万输入才 1 分多钱,适合跑高频工具调用,跟 Ultra 搭配干活很划算。
NVIDIA开源了30B MoE,激活才3B,跑起来便宜,还配了个路由器帮你省钱,搞智能体的可以看看。
NVIDIA 新出的 30B 模型,跑在本地,专门给常驻智能体用,速度快 4 倍,还支持 1M 上下文,搞智能体的可以试试。
NVIDIA 新出的 30B MoE 模型,3B 激活参数跑得快,专为智能体场景优化,Fireworks 上直接能用。
NVIDIA新出的轻量MoE,30B参数只激活3B,跑智能体任务比同类快30%,想省算力可以试试。
蚂蚁百灵开源了个轻量推理模型,7.9B 参数但每 Token 只激活 1.3B,Mac mini 上跑得飞快,适合本地部署。
这篇论文把PTQTP量化器约束成九级格式,在DeepSeek-V4上做到和官方API几乎一样准,还快6.7%、文件小9%,适合搞MoE推理优化的朋友看。
这篇论文用OLMoE和DeepSeek-V2-Lite实测证明,MoE路由的选专家和加权输出不该共用一套分数,FDAA方法能白捡性能提升,做MoE优化的值得看。
SGLang团队搞的FlashBoot,把大模型权重加载从20秒压到0.4秒,跨节点复制只要10毫秒。跑DeepSeek-V4系列,NVL72上实测数据,做弹性部署的值得看。
蚂蚁百灵开源了 Ling-3.0-flash,124B 总参只激活 5.1B,能单机跑,输出超 1100 tokens/s。
想用AMD显卡跑大模型的可以看看,AMD把16B总参数、2.8B激活的MoE模型全开源了,连训练配置和数据配方都给了。
LG开源了韩国最大的K-EXAONE 2.0,750B参数,跑分比初代高10%,长上下文和工具调用还压过了GLM-5.1。
华为盘古 505B 的 MoE 模型 openPangu-2.0-Pro 开源了,带权重和推理代码,支持 512k 上下文,想跑昇腾生态可以看。
Moonshot AI 开源了 MoonEP,一个专门加速 MoE 训练中专家并行通信的库,比现有方案更均衡高效,做分布式训练的同学可以试试。
MoE-LoRA 不用固定 k 值了,CARE 根据 token 难度自动选专家,在 LLaMA 和 Qwen 上效率更高,还能顺手做 OOD 检测。
阿里云真武M890超节点实例首发适配Kimi K3,2.8万亿参数MoE模型推理效率获硬件级优化,适合关注大模型部署和推理加速的开发者。
论文提出DraftExpert,通过训练轻量草稿专家和预取机制,让端侧MoE模型推理速度提升1.45倍,适合关注边缘部署和推理加速的朋友。
Kimi 开源了2.8T参数的K3模型,激活104B参数,能处理百万token上下文,视觉能力也不弱,性能直逼Claude和GPT-5.6,适合用来部署或研究。