Moonshot AI 发布了 2.8T 参数的 Kimi K3,MoE 架构加 1M 上下文,还配套了工具,开源党可以玩起来了。
#MoE
Kimi 新旗舰 K3 登上 Ollama,2.8T MoE 超强视觉理解,还能直接配合 Claude Code 用,性能提升 2.5 倍每单位计算。
月之暗面开源了 2.8 万亿参数的 Kimi K3,MoE 架构效率比 K2 高 2.5 倍,支持 100 万 token 上下文和视觉推理,值得关注。
vLLM 出了个新插件,把 MoE 推理的注意力层和专家层拆分部署,想分别扩缩容就方便了,支持 NVIDIA 和昇腾卡。
蚂蚁发了新MoE模型Ling-3.0-flash,124B参数但只激活5.1B,跑得快,还免费一周。适合搞智能体、编码或搜索任务,快去体验。
想省token跑agentic任务?试试Ling-3.0-flash,124B参数只激活5B,OpenRouter上免费到8月3日。
阿里云用真武 M890 跑通了 2.4 万亿参数的 Qwen3.8,显存 9TB,推理性能还提升了 1.5 倍,国内头一个做到的。
Solar Open 2 发了,250B MoE 模型,1M token 超长上下文,专门跑复杂智能体任务。MMLU-Pro 和 LiveCodeBench 都领先,韩语能力还特别强,比 DeepSeek-V4-Pro 小很多但性能接近。
英伟达用 Blackwell GB300 跑 DeepSeek-v3,每 GPU 1648 TFLOPs,比上一代快 3 倍,技术优化真猛。
Poolside开源了Laguna S 2.1,118B参数只要8B激活就能跑,单卡DGX Spark就能用,还能和超大模型正面刚!
PoolsideAI 出的 Laguna S 2.1,118B MoE 带 1M 上下文,Terminal-Bench 上 70.2%,专搞编码智能体,想试试直接去 OpenRouter 用。
poolside 新出的 Laguna S 2.1 开源又高效,118B 模型只激活 8B 就能跑,还支持 1M 上下文,值得一试。
这篇论文展示了PagedWeight方法,能在MoE模型服务里动态量化权重,省内存还保准,比之前的方法效果明显更好。
阿里云新出的超节点实例M890,单台就能跑十万亿参数的大模型,训练性能比上一代快三倍,适合搞大模型训练和推理的团队。
Think Machines的Inkling模型很特别,总参数975B但只激活41B,还有1M上下文和多种模态支持,值得上手试试。
Kimi 发了 K3,用 KDA 和 AttnRes 让长序列处理更流畅,MoE 专家数拉到 896 只激活 16 个,扩展效率翻倍,适合追新架构的朋友。
Inkling 是 Thinking Machines Lab 的新多模态 MoE 模型,同时支持文本、图像、音频输入,还能控制推理计算量,效率很高。
Moonshot AI 把 2.8 万亿参数的 Kimi K3 开源了,用了新注意力机制,还有 1M 上下文,直接看技术细节就对了。
Mira Murati 的新实验室发布了 Inkling,975B 参数的 Apache-2.0 多模态开源模型,专门为微调设计,想折腾的开发者可以试试。
thinkymachines开源了一个超大MoE模型Inkling,总参975B但只激活41B,还支持1M上下文和图文音频理解,已经可以在SGLang上跑了,想玩大模型的朋友可以试试。
Mira Murati 新公司出了开源多模态模型,近 1T 参数但只激活 41B,支持 1M 上下文,还能自己微调,值得试试。
Mira Murati团队开源了多模态模型Inkling,975B参数,比Nemotron和Kimi K2.5强,指令遵循甚至超Claude,值得一试。
Inkling 让你能控制模型思考深度,975B 参数但只激活 41B,适合做定制化基础模型。
Soofi 出了一款开源模型,31.6B参数只激活3.2B,混合Mamba+Transformer架构,支持德语和英语,适合多语言场景。
Thinking Machines开源了975B参数的MoE模型Inkling,支持多模态和64K/256K长上下文,还能在Tinker上微调,值得试试。
这篇论文实测了华为昇腾跑MoE和多模态大模型的工程代价——需要打12个补丁、关掉一堆特性才能不出错,想用非GPU加速器的团队先看看这个。
蚂蚁灵波开源了LingBot-Video,专为机器人设计,RBench上超过Wan2.6,推理快3倍,适合做训练数据。