Transcribe-2-Streaming

general · 首次出现 2026-10-01 · 最近出现 2026-10-02 · 累计提及 18

综述

Transcribe-2-Streaming 是微软 MAI 语音模型家族中的实时流式转录模型,全称 MAI-Transcribe-2-Streaming,特点是边收音边输出文字,而非等整段音频结束后再转写。它与同批亮相的另外两款语音模型一起发布,被视为微软自研 AI 团队加码语音赛道的信号。

Transcribe-2-Streaming 近期进展

  • 官方发布:微软 AI 官方账号宣布一次性推出三款语音模型,Transcribe-2-Streaming 作为其中的流式转录成员亮相,微软 AI 负责人 Mustafa Suleyman 也在个人账号同步官宣,将其描述为实时转录模型。微软发布三款语音模型、微软发布MAI-Transcribe-2-Streaming实时转录模型
  • 第三方跟进:AI 评测机构 Artificial Analysis 与科技媒体 TestingCatalog 均在发布当天报道,把 MAI-Transcribe-2-Streaming 归入微软的语音转录与生成产品线。微软发布MAI-Transcribe-2-Streaming语音转写模型、Microsoft发布MAI语音转录与生成模型
  • 渠道落地:这批 MAI 模型已登陆 Vercel 平台,开发者可以较为便捷地接入试用;中文科技媒体 IT之家也以「流式转录模型」为题做了报道。微软MAI模型登陆Vercel平台、微软发布流式转录模型 MAI-Transcribe-2-Streaming
  • 当前焦点与观察点

    流式转录与传统批处理转写的差异主要在延迟:前者在说话过程中逐段产出文本,适合会议纪要、直播字幕、语音助手等对实时性敏感的场景,这正是 Transcribe-2-Streaming 的主攻方向。

    目前公开信息尚未披露参数量、定价与基准成绩,后续值得关注的观察点包括:Artificial Analysis 等第三方的延迟与准确率实测、多语言及中英混说表现,以及它与 Whisper 等主流方案在流式场景下的差距。若性能数据得到验证,实时语音接口市场的竞争将进一步升温。

    相关报道

    9 条在档