Fujitsu 的工程师要在 PyTorch 大会讲怎么用 vLLM 和 OpenVINO 在 ARM CPU 上跑 MoE 模型,做端侧部署的可以关注。
#MoE
Kimi K3 在 TPU 上跑到 709 tokens/s,比 GB200 还快,92 个 MoE 层塞进一个 Pallas kernel,做法挺巧,做推理的可以看看。
蚂蚁开源了个 9.57M 参数的小声纹模型,100ms 延迟就能实时验证身份,银行核身、端侧解锁直接能用,小模型打大模型这点挺有意思。
300 亿参数的 MoE 模型跑进手机了,内存砍半,预填充 330 Token/s,邮件、行程规划全在本地完成,不用联网。
一篇发表在 npj Digital Medicine 上的方法论文,用 MoE 加层级一致性来做脑连接组合成,还能一次预测多种大脑特质,做医学影像方向可以看看。
Boltzbit 和剑桥把对话内容动态编译成 LoRA 权重贴到模型上,长文档和多轮对话反超堆 Prompt,每轮算力还恒定。
StepFun 推出了 Step 5 预览版,包含一个 600B 稀疏 MoE 模型,支持 1M 上下文,适合长时程任务。
上海AI实验室新出的Atria Dawn Preview模型,参数量744亿,上下文256K,自动化基准测试分数53.8,适合做长周期研究和工程类任务。
朋友,Deepseek 新出的 552B 大模型现在在 Fireworks 上能用,做编程和网络安全很厉害,比 GPT 5.6 Sol 便宜很多。
朋友,Deepseek 新出的 552B 大模型现在在 Fireworks 上能用,编程和网络安全方面比 Opus 5 强,还便宜很多。
DeepSeek 新出的 V4.1 Flash 模型,参数量 552B,用起来比上一代便宜很多,缓存需求也少,适合做 Agent 之类的任务。
DeepSeek 新发布的 552B 参数模型,架构更高效,成本更低,性能还比 DeepSeek-V4-Pro 更强。
研究人员提出了一种方法,能通过小模型实验,准确预测万亿 token 规模 MoE 模型的最优学习率,省去了大量计算成本。他们用 155B 参数的模型验证了方法的有效性。