Voice-2

general · 首次出现 2026-06-02 · 最近出现 2026-10-02 · 累计提及 30

综述

MAI-Voice-2 是微软自研 MAI 模型家族中的语音生成模型系列,主打实时、低延迟的语音合成能力。该系列近期迭代至 2.1 版本并推出 Flash 轻量变体,同时通过 OpenRouter、Vercel 等第三方平台向开发者开放。

Voice-2 系列近期进展

Flash 版主打速度与多语言。 速度提升 2 倍、支持 15 种语言,是 MAI-Voice-2-Flash 的两个核心指标,面向高频调用的实时场景(MAI-Voice-2-Flash 发布:速度提升2倍,支持15种语言)。

语音能力进入微软自家产品。 据报道,MAI-Voice-2-Flash 与图像模型 MAI-Image-2.5-Pro 一同发布,并已落地 Bing 和 PowerPoint(微软发布MAI-Image-2.5-Pro与MAI-Voice-2-Flash模型,已落地Bing和PowerPoint)。

版本迭代至 2.1 并上架聚合平台。 MAI-Voice-2.1 与 MAI-Voice-2.1-Flash 两个版本均已上线 OpenRouter,标准版与轻量版并行供应(MAI-Voice-2.1 上线 OpenRouter、MAI-Voice-2.1-Flash 上线 OpenRouter)。

转录与生成配套推出。 微软同期发布了实时语音转录模型 Transcribe-2-Streaming,与语音生成端形成完整链路(Microsoft 发布实时语音转录模型 Transcribe-2-Streaming)。

当前焦点与观察点

分发渠道是这一系列最受关注的变化。除微软自有生态外,MAI 系列模型已接入 Vercel AI Gateway(MicrosoftAI 模型接入 Vercel AI Gateway),叠加 OpenRouter 上架,微软明显在借助第三方聚合平台触达更多开发者。

版本策略上,标准版与 Flash 版并行,反映出语音模型在音质与延迟、成本之间的取舍:Flash 承接实时对话类应用,标准版承担更高质量输出。随着 2.1 版本与转录模型组成“识别+生成”的完整组合,MAI-Voice-2 系列在实时语音市场上与 OpenAI、ElevenLabs 等对手的竞争值得关注。

相关报道

10 条在档