Transcribe-2-Streaming 是微软 MAI 语音模型家族中的实时流式转录模型,全称 MAI-Transcribe-2-Streaming,特点是边收音边输出文字,而非等整段音频结束后再转写。它与同批亮相的另外两款语音模型一起发布,被视为微软自研 AI 团队加码语音赛道的信号。
Transcribe-2-Streaming 近期进展
当前焦点与观察点
流式转录与传统批处理转写的差异主要在延迟:前者在说话过程中逐段产出文本,适合会议纪要、直播字幕、语音助手等对实时性敏感的场景,这正是 Transcribe-2-Streaming 的主攻方向。
目前公开信息尚未披露参数量、定价与基准成绩,后续值得关注的观察点包括:Artificial Analysis 等第三方的延迟与准确率实测、多语言及中英混说表现,以及它与 Whisper 等主流方案在流式场景下的差距。若性能数据得到验证,实时语音接口市场的竞争将进一步升温。