主要来源vLLM
查看原文事件专题 · 多源确认
MiniMax M3 发布:1M 上下文、稀疏注意力、开源模型
MiniMax AI 发布了新一代开源模型 MiniMax M3,具备前沿的编码和智能体能力,原生支持图像和视频输入、计算机使用功能,并拥有 100 万 token 的上下文窗口。其核心是 MSA(MiniMax Sparse Attention)稀疏注意力架构,通过仅对 top 128-token KV 块进行注意力计算,大幅降低了长上下文推理的计算成本。M3 已在 vLLM 中实现首日支持,可在 NVIDIA 和 AMD 硬件上运行,支持 BF16 和 MXFP8 检查点、MoE 后端、多模态输入、工具调用和推理控制。这一成果是 MiniMax、NVIDIA、AMD 和 vLLM 社区合作的结晶。
当前结论
M3 的 1M 上下文和稀疏注意力架构解决了长文档和复杂智能体任务的性能瓶颈,做 RAG、代码分析和自动化工作流的团队可以直接在 vLLM 上部署试用。
11 个信源73° AI 热度最后更新 2026/6/12 14:47:34
证据链
相关来源 1LMSYS Org (SGLang)
查看原文相关来源 2Together AI
查看原文相关来源 3NVIDIA AI
查看原文相关来源 4IT之家
查看原文相关来源 5Decoder
查看原文相关来源 6SiliconFlowAI
查看原文相关来源 7Poe
查看原文相关来源 8lmarena.ai
查看原文相关来源 9ollama
查看原文相关来源 10karminski-牙医 (AI工具)
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。