语音识别·general

语音识别

别名
首次出现
2026-05-22
最近出现
2026-07-29
累计提及
33
§ 01综述

语音识别是指计算机将语音信号转换为文本的技术,近年来在深度学习推动下取得了显著进步,特别是在实时性、多语言支持和纠错能力方面。当前,语音识别已从单一的转录任务演进为集成说话人分离、流式处理和多模态交互的智能语音接口。

语音识别近期进展

  • 开源扩散ASR模型:Interfaze发布了基于DiffusionGemma的开源扩散ASR模型,支持六语言转录,通过并行去噪解码实现高质量转录。该模型在精度和灵活性上为开发者提供了新选择。Interfaze开源扩散ASR模型,基于DiffusionGemma,支持六语
  • 实时流式ASR模型:NVIDIA发布Nemotron 3.5 ASR,仅600M参数即可实时转录40种语言,采用缓存感知设计,在效率和精度上取得平衡。微软MAI-Transcribe-1.5也刷新了FLEURS基准,词错误率低至2.4%,长音频转录速度提升5倍。NVIDIA发布Nemotron 3.5 ASR:600M参数流式模型实时转录40种语言微软发布 MAI-Transcribe-1.5:WER 2.4%,长音频转录快 5 倍
  • 语音与AI Agent集成:xAI推出Voice Agent Builder,将Grok Voice与语音API结合,允许开发者构建支持实时语音交互的智能体。Vercel也在其AI Gateway中增加了实时语音转录功能,进一步降低了开发门槛。xAI推出Voice Agent Builder,整合Grok Voice与语音API栈Vercel 在 AI Gateway 中推出实时语音与转录功能
  • 用户生态反馈:中文社区用户评测FunASR在性价比上超越Whisper,配合LLM纠错可弥补精度不足,表明语音识别正与LLM深度结合。用户评价FunASR:性价比超Whisper,配合LLM修复可解决精度问题
  • 当前焦点与观察点

    当前语音识别的焦点集中在开源与专用模型的竞争、多语言流式能力的普及、以及与大语言模型的融合。一方面,模型参数规模在减小,但精度和速度持续提升,如NVIDIA和微软的模型;另一方面,开源社区如Interfaze和FunASR降低了使用门槛,但需与LLM配合弥补鲁棒性。争议点包括:评测基准是否全面反映真实场景,模型部署成本与隐私问题,以及语音识别在对话系统中的应用边界。可以预见,语音识别将更紧密地嵌入Agent和实时交互场景,成为多模态AI的关键入口。

    § 02相关报道10 条在档
    1. 01
      OpenAI 发布 GPT Transcribe,错误率仍落后 ElevenLabs、Google 和 Mistral
      Decoder
    2. 02
      OpenAI 发布 gpt-transcribe,词错误率减半价格低
      小互
    3. 03
      OpenAI 引入两种转录模型:低延迟、更好理解上下文
      IT之家
    4. 04
      Deepgram增强Amazon SageMaker AI支持,引入IAM临时委托
      AWS Machine Learning Blog
    5. 05
      Grok STT 在 OpenRouter 上线,支持 25 种语言的语音转文字
      OpenRouter
    6. 06
      Vercel AI Gateway 新增实时音频转录,支持构建语音代理
      Guillermo Rauch
    7. 07
      Cohere Transcribe 月下载量破100万,总下载量达237万
      Cohere
    8. 08
      Daniel Povey 当选 2026 ISCA Fellow,小米语音首席科学家再获殊荣
      IT之家
    9. 09
      又快又聪明,阿里发布Qwen-Audio-3.0-Realtime:实时语音大模型四项功能升级
      量子位
    10. 10
      使用冻结DiffusionGemma离散扩散模型的音频原生语音识别
      arXiv cs.AI
    § 03邻近话题

    本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

    /topic/%E8%AF%AD%E9%9F%B3%E8%AF%86%E5%88%AB