微软弄了个能边听边说的语音模型MAI Realtime,支持16种语言,还能中途换语言,比Copilot现在的语音更自然。
微软正测试其首款原生实时语音模型MAI Realtime,采用全双工交互,可同步聆听和回应,不必等用户说完。该模型支持中文等16种语言,提供Victoria和Grant两种语音风格。测试在MAI Playground平台进行,尚未上线Microsoft Foundry。相比Copilot现有语音模式更自然,但定位仍是对话系统,不支持唱歌或音效。
微软测试其首款自研全双工 AI 语音 MAI Realtime 模型:支持中文等 16 种语言、2 种风格
IT之家 8 月 4 日消息,科技媒体 TestingCatalog 于 8 月 2 日发布博文,报道称微软正测试其首款原生实时语音模型 MAI Realtime, 支持 16 种语言、2 种语音,可在对话中听说并行,支持自动识别和中途切换语言。 测试方面,消息称微软已邀请部分合作伙伴,在 MAI Playground 平台测试该模型,目前尚不清楚何时上线 Microsoft Foundry,以及扩展到 Copilot 语音功能上。 运行方面,MAI Realtime 采用双向、全双工交互方式,无需严格按“用户说完、模型再答”的轮次交替,可支持同步聆听和回应。 在支持语言方面,MAI Realtime 模型支持中文等在内 16 种语言,IT之家援引博文介绍,附上相关支持的语言如下: 英语 德语 西班牙语 法语 意大利语 葡萄牙语 日语 韩语 中文 荷兰语 印地语 印度尼西亚语 阿拉伯语 俄语 土耳其语 越南语 泰语 在语音风格方面,消息称该模型测试提供 Victoria 和 Grant 两种语音,比 Copilot 目前的语音模式更加自然。用户可以主动地指定语言,也可以启用自动检测。 该模型不支持唱歌或生成非语音音效,定位仍是对话系统。调试面板可显示实时延迟、模型思考内容和处理步骤,样本分享功能或将在测试权限扩大后向平台用户开放。 IT之家注:全双工语音(Full-duplex voice)指系统可在同一时间接收用户语音并输出回复,不必等待一方完全说完。它依靠端点检测识别说话开始、停顿和结束,也需要在用户插话时调整输出。 微软此前发布的 MAI 语音模型均为单向模型,包括用于语音合成的 MAI-Voice-2 及其 Flash 版本,以及用于语音识别的 MAI-Transcribe-1.5。