LingBot-Video 刚上 Hugging Face,30B 参数但推理只激活 3B,还加了 7 万小时具身数据,适合做机器人视觉。
#MoE
腾讯Hy3开源模型295B参数,比GLM-5.2小一半却和GPT-5.5打平,还超过DeepSeek V4 Pro,免费API两周,智能体应用很香。
NVIDIA 刚开源的 75B MoE 模型,实际只激活 9.3B 参数,单卡就能跑百万 token 上下文,适合长文档或代码分析。
Bleys 算了一笔账:GPT-5.6 Sol 参数 2-4 万亿、跑在 Cerebras 晶圆上、速度 750 token/s,但价格可能翻倍。想了解下一代超大规模模型怎么造?看这个。
腾讯刚开源Hy3,激活21B参数就能在SWE-Bench拿到78.0,还支持256K长上下文,想尝鲜推理模型的话OpenRouter上免费到7月21日。
MistralAI 的 Leanstral 1.5 用 6B 活跃参数就拿下 miniF2F 满分,每个问题才 4 美元,做数学证明的可以试试。
这篇论文用两个通用语料就能做好MoE剪枝,在Qwen和DeepSeek模型上准确率更高,尤其适合需要极限压缩的场景。
美团搞了个纯国产卡训练的1.6T MoE模型,激活参数48B,1M上下文,编程和Agent场景表现强,在SWE-bench Pro上还超过了GPT-5.5,值得编程开发者试试。
这篇论文提出了一种简单通用的优化器改进方案,能解耦权重幅度和方向,消除权重衰减和warmup,在Adam和Muon上都有效,值得关注。
NVIDIA 出了个 NeMo AutoModel,基于 Hugging Face Transformers v5,几行代码就能给 MoE 模型训练加速 3 倍以上,搞大模型训练的值得看看。
阿里新开源了35B参数的MoE模型,只激活3B,256K超长上下文,配合AgentWorldBench,研究智能体世界建模的赶紧试试。
这篇论文提出了 CrossPool,通过分离权重和 KV-cache 池,能大幅降低冷 MoE 模型的推理延迟,比现有系统快 10 倍以上。
Prime Intellect 新开源的 prime-rl 0.6.0,专为训练万亿参数 MoE 模型的强化学习设计。他们在 SWE 任务上用 GLM-5 跑到 131k 序列长度,速度还很快,想了解大规模 RL 训练优化的可以看看。
Liquid 这个 8B MoE 模型只用 4.8GB 内存就比 OpenAI 20B 模型多调用了一倍工具,速度还快两倍,本地跑 agent 任务很实用。
LMSYS 和 InclusionAI 联手,用 SGLang-JAX 让 1T 参数 MoE 在 TPU 上跑得快 53%,技术细节都在博客里。