月之暗面开源了 2.8 万亿参数的 Kimi K3,MoE 架构效率比 K2 高 2.5 倍,支持 100 万 token 上下文和视觉推理,值得关注。
月之暗面开源了 Kimi K3 模型,参数规模达 2.8 万亿,基于 KDA 混合线性注意力机制和注意力残差技术构建。该模型原生支持视觉理解,拥有 100 万 token 上下文窗口,采用 MoE 架构在 896 个专家中激活 16 个。相比前代 K2,Kimi K3 的扩展效率提升约 2.5 倍,在长程编码、软件工程与视觉推理任务上表现突出。官方评测显示,K3 整体落后于闭源模型 Claude Fable 5 和 GPT-5.6 Sol,但超过了其他所有模型。
IT之家 7 月 27 日消息,月之暗面官方今晚正式开源 Kimi K3 模型。 Kimi K3 是一个 2.8 万亿参数模型 ,基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,原生支持视觉理解,并拥有 100 万 token 上下文窗口 。 官方表示,Kimi K3 是首个达到 2.8 万亿参数规模的开源模型,在过去 12 个月中的 9 个月里,Kimi 模型都保持着开源模型的规模上限。 Kimi 还进一步扩大了 Mixture of Experts(MoE)的稀疏度:结合 Stable LatentMoE 框架后,模型可以在 896 个专家中高效激活 16 个。再加上训练方法和数据配方的优化,这些结构性改进让 Kimi K3 相比 K2 的整体扩展效率提升约 2.5 倍,能更有效地把算力转化为能力。 据介绍,Kimi K3 具备很强的长程编码能力。在极少人工监督的情况下,它可以持续完成长时间工程任务,理解和处理大型代码库,并协调使用终端工具;Kimi K3 也擅长结合软件工程与视觉推理的任务。它能够利用截图和视觉反馈,优化游戏开发、前端和 CAD 等场景。 官方表示,虽然 Kimi K3 的整体表现仍落后于最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol,但在整套评测中展现出前沿水平的能力,并稳定超过了其他所有模型。 IT之家附开源链接: https://huggingface.co/moonshotai/Kimi-K3 https://github.com/MoonshotAI/Kimi-K3