7月31日
19:02
19:02官方账号阿里通义 Qwen@Alibaba_Qwen
精选
阿里云推出ASR模型Qwen-Audio-3.0-ASR-Flash,主打上下文一致性和领域术语识别。内部测试中,医疗术语召回率达95.36%,工业术语召回率达93.24%。该模型支持自定义热词,并可将语音润色为结构化文本。同步提供流式与文件转写两个版本。
事件专题

推荐理由:语音识别总听错专业词?试试这个新模型,医疗术语召回95.36%,还能自定义热词和输出结构化文本。
7月29日
18:15
18:15小互@imxiaohu
83°
OpenAI 发布 gpt-transcribe 和 gpt-live-transcribe 两个语音转录模型。在真实世界录音基准上,gpt-transcribe 词错误率为 8.98%,相比 Whisper-1 的 15.21% 下降约一半。价格方面,gpt-transcribe 每分钟仅需 $0.0045,比 Whisper-1 的 $0.006 便宜 25%。
事件专题

推荐理由:OpenAI 这次发了两个转录模型,gpt-transcribe 在真实录音上词错误率只有 8.98%,比之前的 Whisper-1 好了一半,而且每分钟还便宜 25%,做语音转录的可以看看。
7月28日
7月25日
04:32
7月24日
02:04
7月22日
03:01
7月15日
7月8日
02:09
02:09官方账号Decoder@Matthias Bastian
Cohere发布了开源模型Transcribe Arabic,拥有20亿参数,专为阿拉伯语方言、代码切换和阿拉伯语-英语双语语音识别优化。该模型在多项测试中性能超过Whisper和OmniASR。模型已上传至Hugging Face,采用Apache 2.0许可证。

推荐理由:Cohere搞了个阿拉伯语语音模型,20亿参数,专门对付方言和双语,据说比Whisper还牛,搞语音识别的快试试。
7月7日
7月2日
02:45
02:45官方账号xAI@xai
xAI发布了Voice Agent Builder,专为Grok Voice设计。传统语音系统需拼接语音转文本、语言模型及文本转语音三个API,每步切换增加成本、延迟与故障点。Voice Agent Builder将三个阶段紧密耦合至单一模型,减少跳转开销。该工具旨在优化实时语音交互体验。
推荐理由:xAI把语音转文字、大模型、文字转语音三个环节整合到一个接口里,延迟更低、故障更少,用Grok Voice搞语音交互的可以试试。
6月29日
17:55
13:51
13:51官方账号Together AI@togethercompute
Together AI 构建了基于 Parakeet 的语音转文本堆栈,每秒可处理约 302 秒音频,这是 Artificial Analysis 报告中最高速度因子。该堆栈在 Together 平台上运行,通过系统级优化实现低延迟转录。文章由 @FeelTheBeurn 详细拆解了背后的工程工作。

推荐理由:Together AI 把 Parakeet 优化到每秒转写 302 秒音频,比别的服务快一大截,想搞语音识别的可以看看这篇系统调优拆解。
6月16日
02:02
02:02Jerry Liu@jerryjliu0
Karan Goel 团队发布 Sonic-3.5(文本转语音)和 Ink-2(语音转文本)两种流式模型。新架构实现了速度和质量的突破,将两者推向各自类别的榜首。该团队自称是目前唯一同时拥有排名第一的语音输入和输出模型的提供商。
推荐理由:Karan Goel 发了两个新模型,Sonic-3.5 做 TTS 排名第一,Ink-2 做 STT 也是第一,说是唯一一家听说都做到顶的。做语音智能体的话看看。
6月12日
13:08
13:08官方账号Guillaume Lample (Mistral)@GuillaumeLample
Mistral 发布了 Voxtral 2,包含两个新模型:Voxtral Realtime(实时转录,延迟可低于 200 毫秒,Apache 2 许可)和 Voxtral Mini Transcribe 2(支持说话人分离、词级时间戳和上下文偏置)。该模型支持 13 种语言,通过 Mistral API 提供,是市场上性价比最高的转录 API 之一。

推荐理由:做语音转录或实时字幕的开发者终于有了一个开源且低延迟的选择——Voxtral Realtime 的 Apache 2 许可和 sub-200ms 延迟值得一试。
6月8日
17:03
17:03官方一手marktechpost@Asif Razzaq
精选
微软 AI 发布了其自研语音转文字模型 MAI-Transcribe-1.5,这是该系列的第二代。该模型支持 43 种语言,在 Artificial Analysis 排行榜上词错误率低至 2.4%,在 FLEURS 基准测试中达到最佳精度。它引入了关键词(实体)偏置功能,可针对特定领域术语提升识别准确率。长音频转录速度提升高达 5 倍,1 小时音频可在 15 秒内完成转录。该模型已在 Azure AI Foundry 中正式可用。
推荐理由:语音转文字场景的开发者终于有了微软官方的强力选项——MAI-Transcribe-1.5 在精度和速度上双双突破,做会议转录、客服质检或多语言内容处理的团队可以直接在 Azure 上试用,省去自建模型的麻烦。
6月5日
21:46
21:46官方账号Together AI@togethercompute
Together AI 宣布在其平台上推出两款 NVIDIA Nemotron 模型:Nemotron 3 Ultra 专为高吞吐量的智能体工作负载设计,适合构建编码智能体和深度研究智能体;Nemotron 3.5 ASR 则专注于低延迟的多语言语音识别,适用于实时语音系统。这为 AI 原生开发者提供了在 AI Native Cloud 上构建复杂应用的新选择,降低了部署门槛。
事件专题

推荐理由:做智能体或语音应用的开发者现在有了更专业的模型选择——Nemotron 3 Ultra 适合高并发任务,Nemotron 3.5 ASR 能直接用于多语言实时语音场景,值得在 Together AI 上试试。
6月3日