16:05IT之家(博客/媒体)阿里云推出Qwen-Audio-3.0系列语音模型,包含ASR、TTS、Realtime三款,已上线千问AI平台和阿里云百炼平台。该系列在Artificial Analysis今年7月的语音排行榜中,拿下语音识别、实时交互、语音合成三个赛道全球第一。Qwen-Audio-3.0-ASR支持复杂语境和专业领域识别,Qwen-Audio-3.0-TTS支持多语种多方言并可控制情绪语气节奏。Qwen-Audio-3.0-Realtime支持端到端语音理解与对话,可边听边说、随时打断追问,并支持工具调用。AI模型Qwen-Audio-3.0阿里云千问推荐理由:阿里自家的新语音模型,ASR、TTS、实时对话都拿了全球第一,现在API直接能用。做语音应用的话值得试试。原文稍后读已读值得跟进有用关注 Qwen-Audio-3.0
19:38Hunyuan@TXhunyuan腾讯混元发布Hy ASR 3.0预览版,基于Hy3语言大脑将语音识别与语义理解融合。该模型在通用识别、上下文感知、多场景鲁棒性和方言覆盖等维度表现领先。官方公布多语言词错误率(WER)约为3%,能将嘈杂的真实世界音频转换成干净连贯的文本,并准确捕捉说话者意图。AI模型Hy ASR 3.0腾讯混元Hy3推荐理由:腾讯混元出了Hy ASR 3.0,多语言WER约3%,嘈杂音频也能转成干净文字,还懂方言。原文稍后读已读值得跟进有用关注 Hy ASR 3.0
16:26IT之家(博客/媒体)腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview,基于大语言模型 Hy3 融合语音识别与语义理解。该模型在开源评测集中中文普通话 WER 为 3.34%,英语为 2.62%,粤语为 3.12%。在自建评测集上,通用识别、方言、上下文理解等场景 WER 保持较低水平。腾讯元宝已首发接入该模型,支持方言识别与上下文纠错,并免费开放。Hy ASR 3.0 preview 已上线腾讯云 API 服务。AI模型腾讯混元Hy ASR 3.0元宝推荐理由:腾讯混元出了新语音识别模型 Hy ASR 3.0,粤语英语 WER 都压到 3% 左右,元宝里已经能免费用了。原文稍后读已读值得跟进有用关注 腾讯混元
19:02官方账号阿里通义 Qwen@Alibaba_Qwen精选阿里云推出ASR模型Qwen-Audio-3.0-ASR-Flash,主打上下文一致性和领域术语识别。内部测试中,医疗术语召回率达95.36%,工业术语召回率达93.24%。该模型支持自定义热词,并可将语音润色为结构化文本。同步提供流式与文件转写两个版本。AI模型Qwen-Audio-3.0-ASR-Flash阿里云语音识别1 个信源在谈事件专题推荐理由:语音识别总听错专业词?试试这个新模型,医疗术语召回95.36%,还能自定义热词和输出结构化文本。原文稍后读已读值得跟进有用关注 Qwen-Audio-3.0-ASR-Flash
13:16官方一手marktechpost@Michal SutterPolyAI推出Dialog-RSN-1,该模型直接感知来电者音频,而非读取ASR转录文本。它在一个音频原生模型中融合了轮转、语音识别、函数调用和响应生成,同时将TTS独立出来以保持输出声音可控。模型以基于请求的LLM方式运行,而非始终在线的流式架构。PolyAI报告在实时部署中响应时间低于300毫秒。AI模型Dialog-RSN-1PolyAI语音识别推荐理由:PolyAI出了个新对话模型Dialog-RSN-1,直接听人说话不用转文字,还能自动接话和调函数,延迟不到300毫秒。原文稍后读已读值得跟进有用关注 Dialog-RSN-1
13:04IT之家(博客/媒体)阿里巴巴发布语音识别大模型 Qwen-Audio-3.0-ASR-Flash,针对上下文一致性、行业词识别和热词定制化做了优化。模型内置覆盖医疗、IT 编程、股票等领域的高质量词库,在内部评测中医疗场景专业词听中率达 95.36%。该模型曾在 Artificial Analysis 上以 1.7% 的错字率拿下全球第一。目前已在阿里云百炼平台开放,提供 Flash、Filetrans、Streaming 三个版本。AI模型Qwen-Audio-3.0-ASR-Flash阿里云百炼语音识别1 个信源在谈事件专题推荐理由:阿里把语音识别模型更新到 3.0,医疗等专业词识别更准了,错字率低到 1.7%,还开放了三个版本随便用。原文稍后读已读值得跟进有用关注 Qwen-Audio-3.0-ASR-Flash
21:26官方账号Decoder@Jonathan KemperOpenAI 发布了两款新的语音识别模型 GPT Transcribe 和 GPT Live Transcribe。它们在错误率上优于前代 Whisper,但仍高于 ElevenLabs、Google 和 Mistral 的当前最优水平。当前 ElevenLabs 的语音识别错误率最低,Mistral 和 Google 紧随其后。GPT Transcribe 支持更多语言和实时转录功能,适合轻度使用。AI模型GPT TranscribeGPT Live TranscribeOpenAI10 个信源在谈事件专题推荐理由:OpenAI 出了新语音转文字模型,错误率比 ElevenLabs 高不少,自己测试可以,正经用还是优先选 ElevenLabs 吧。原文稍后读已读值得跟进有用关注 GPT Transcribe
18:15小互@imxiaohu83°OpenAI 发布 gpt-transcribe 和 gpt-live-transcribe 两个语音转录模型。在真实世界录音基准上,gpt-transcribe 词错误率为 8.98%,相比 Whisper-1 的 15.21% 下降约一半。价格方面,gpt-transcribe 每分钟仅需 $0.0045,比 Whisper-1 的 $0.006 便宜 25%。AI模型gpt-transcribegpt-live-transcribeWhisper-110 个信源在谈事件专题推荐理由:OpenAI 这次发了两个转录模型,gpt-transcribe 在真实录音上词错误率只有 8.98%,比之前的 Whisper-1 好了一半,而且每分钟还便宜 25%,做语音转录的可以看看。原文稍后读已读值得跟进有用关注 gpt-transcribe
07:06IT之家(博客/媒体)OpenAI 推出 GPT-Live-Transcribe 和 GPT-Transcribe 两种转录模型,已开放 API 调用。GPT-Live-Transcribe 专为低延迟实时转录设计,费用每分钟 0.017 美元;GPT-Transcribe 用于异步转录,费用每分钟 0.0045 美元。在 Context Aware ASR 基准上,GPT-Transcribe 语义准确率从无上下文的 41.6% 提升至有上下文的 45.2%。在 Common Voice 22 种语言上,GPT-Transcribe 转录错误率为 19.27%,低于 Whisper(whisper-1)的 40.37%。在真实世界音频九种语言上,其转录错误率 8.98%,Whisper 为 15.21%。AI模型OpenAIGPT-Live-TranscribeGPT-Transcribe10 个信源在谈事件专题推荐理由:OpenAI 出了两款转录模型,GPT-Live-Transcribe 实时转录延迟低,GPT-Transcribe 批量处理更便宜,错误率比 Whisper 低一半多。原文稍后读已读值得跟进有用关注 OpenAI
00:26官方一手AWS Machine Learning Blog@Victor WangDeepgram通过AWS IAM临时委托机制,增强了对Amazon SageMaker AI的集成支持。该机制允许Deepgram在客户授权后临时访问SageMaker AI环境,从而快速诊断问题。Deepgram称,支持工单的初始调查时间从数天缩短至几分钟。AI产品DeepgramAmazon SageMaker AIAWS IAM推荐理由:Deepgram用IAM临时委托让SageMaker AI支持从几天缩到几分钟,省心省力。原文稍后读已读值得跟进有用关注 Deepgram
04:32OpenRouter@OpenRouterAI72°SpaceXAI 的 Grok STT 已上线 OpenRouter 平台。该模型支持 25 种语言,提供单词级时间戳和说话人分离功能。定价为每音频小时 0.10 美元。AI产品GrokSTTSpaceXAI推荐理由:Grok STT 刚上线 OpenRouter,25 种语言语音转文字才 0.1 刀一小时,还有说话人分离,做音频处理很划算!原文稍后读已读值得跟进有用关注 Grok
02:04Guillermo Rauch@rauchgVercel 的 AI Gateway 新增了 live audio 转录功能,支持将音频流实时转录并流式返回。用户可以通过 streamTranscribe 接口构建语音代理。该功能让语音交互更自然,无需等待完整音频处理完成。AI产品VercelAI GatewaystreamTranscribe推荐理由:Vercel AI Gateway 现在能实时转录音频了,说话的同时就能看到文字,做语音代理很方便。原文稍后读已读值得跟进有用关注 Vercel
03:01官方账号Cohere@cohereCohere 宣布其开源语音识别模型 Cohere Transcribe 月下载量突破100万,自发布以来总下载量达到237万。该模型专注于多语言和全球适用性,采用开源模式。这一数字反映了开源语音识别模型的强劲需求。AI产品CohereCohere Transcribe语音识别推荐理由:Cohere Transcribe 用237万总下载量证明开源语音模型真香,月活破百万说明大家都在用。原文稍后读已读值得跟进有用关注 Cohere
12:03IT之家(博客/媒体)精选76°小米语音首席科学家 Daniel Povey 当选 2026 ISCA Fellow,全球仅 100 余人获此殊荣。他创建了开源语音工具 Kaldi,2023 年已当选 IEEE Fellow。其团队推出的 Zipformer 被 ICLR 2024 接收为 Oral 论文,Zapformer 将识别精度提升 10%-15%。OmniVoice 支持 600+ 语言,仅需 3-10 秒参考音频,中英文 Seed-TTS / LibriSpeech-PC 基准达 SOTA,Huggingface 下载量超 500 万次。CR-CTC 被 ICLR 2025 接收,让纯 CTC 模型性能比肩 Transducer。行业Daniel PoveyISCA Fellow小米推荐理由:小米语音首席科学家拿了 ISCA Fellow,Kaldi 和 OmniVoice 都是他搞的,业内公认的语音大神。原文稍后读已读值得跟进有用关注 Daniel Povey
12:27量子位@量子位的朋友们73°阿里发布Qwen-Audio-3.0-Realtime实时语音大模型,升级了实时语音识别、语音唤醒、语音合成、情绪识别四项核心功能。该模型在语音识别延迟上进一步降低,支持更自然的语音交互。相比上一代,Qwen-Audio-3.0-Realtime在唤醒准确率和合成自然度上有显著提升。AI模型Qwen-Audio-3.0-Realtime阿里实时语音推荐理由:阿里刚发的Qwen-Audio-3.0-Realtime,实时语音四项升级,又快又聪明,做语音交互项目的可以试试。原文稍后读已读值得跟进有用关注 Qwen-Audio-3.0-Realtime
11:33官方账号arXiv cs.AI@Harsha Vardhan Khurdula, Abhinav Kumar Singh, Yoeven D Khemlani, Vineet Agarwal本文提出用离散扩散语言模型DiffusionGemma(26B MoE)替代自回归解码器进行语音识别。方法冻结Whisper编码器提取声学特征,通过轻量投影器和低秩适配器将音频映射到模型空间,仅训练约42M参数(占0.16%)。研究发现自然训练目标梯度无法有效传递,引入连接主义时序分类(CTC)损失后成功训练。在LibriSpeech test-clean上达到6.6%词错误率,并行解码仅需8步且与语速无关,单适配器训练六种语言(评估了英语、印地语和普通话)。论文DiffusionGemmaWhisperLibriSpeech推荐理由:这个研究用DiffusionGemma做语音识别,并行解码8步就达到6.6%错误率,只训练了0.16%的参数,挺高效的。原文稍后读已读值得跟进有用关注 DiffusionGemma
11:46官方一手arXiv: OpenAI@Sheng Li, Jing Li, Felix Schijve, Jun Hu, Emilia Barakova本文综述了自动语音识别(ASR)在机器人系统中的集成方法,涵盖在线API和本地模型两种方案。重点分析了从传统方法到OpenAI Whisper等深度学习模型的演变,并列举了LibriSpeech、Common Voice等大规模数据集以及Kaldi、ESPnet等开源工具包。系统梳理了基于ROS、云服务和混合架构的部署策略,以及Pepper、NAO等真实机器人平台的应用案例。最后探讨了在动态嘈杂环境中实现多模态交互的挑战,为社交机器人研究者提供了语言交互领域的导航。论文WhisperROS语音识别7 个信源在谈事件专题推荐理由:这篇综述把机器人语音识别的在线API和本地模型方案都讲透了,尤其适合想用Whisper做离线识别的开发者,ROS集成部分很有实操参考。原文稍后读已读值得跟进有用关注 Whisper
02:09官方账号Decoder@Matthias BastianCohere发布了开源模型Transcribe Arabic,拥有20亿参数,专为阿拉伯语方言、代码切换和阿拉伯语-英语双语语音识别优化。该模型在多项测试中性能超过Whisper和OmniASR。模型已上传至Hugging Face,采用Apache 2.0许可证。AI模型CohereTranscribe ArabicWhisper推荐理由:Cohere搞了个阿拉伯语语音模型,20亿参数,专门对付方言和双语,据说比Whisper还牛,搞语音识别的快试试。原文稍后读已读值得跟进有用关注 Cohere
10:07IT之家(博客/媒体)精选73°小米上线 MiMo-V2.5-ASR 全链路语音模型,作为听觉基座支持粤语、吴语、闽南语、四川话等中文方言识别。模型实现中英混转无需预设语种,在强噪音、远场拾音及多人交叉对话场景下达到业界领先水平。API按音频转写时长计费,国内 0.5 元/小时,海外 0.074 美元/小时。AI模型MiMo-V2.5-ASR小米语音识别推荐理由:小米新出的语音模型 MiMo-V2.5-ASR 能听方言、混中英文、扛噪音,每小时才五毛钱,适合做语音转录的朋友试试。原文稍后读已读值得跟进有用关注 MiMo-V2.5-ASR
14:43IT之家(博客/媒体)72°阿里千问升级Fun-ASR-Realtime语音识别模型,单模型支持30种语言和16种方言。在覆盖八大方言区的16种方言测试中,字符准确率平均为88.62%,12类方言上领先火山与腾讯。首字延迟控制在百毫秒级别,流式识别准确率接近离线。针对泰语等东南亚语言优化,识别准确率提升20%。离线版Fun-ASR-Flash在Artificial Analysis上字错率1.7%,位列全球第一。AI模型阿里千问Fun-ASR-RealtimeFun-ASR-Flash推荐理由:阿里千问发了新语音模型,支持30种语言+16种方言,方言准确率干过火山腾讯,离线版字错率全球最低。原文稍后读已读值得跟进有用关注 阿里千问
11:32官方一手marktechpost@Michal Sutter精选Interfaze 开源了 diffusion-gemma-asr-small 模型,采用扩散解码替代自回归。该模型通过一个约42M参数的适配器接入 Google 的 DiffusionGemma。单个适配器可处理六种语言的语音转录任务。转录计算量由去噪步数控制,不受输出文本长度影响。AI模型Interfazediffusion-gemma-asr-smallDiffusionGemma推荐理由:Interfaze开源扩散ASR小模型,一个适配器管六种语言,步数控制成本,很灵活。原文稍后读已读值得跟进有用关注 Interfaze
02:45官方账号xAI@xaixAI发布了Voice Agent Builder,专为Grok Voice设计。传统语音系统需拼接语音转文本、语言模型及文本转语音三个API,每步切换增加成本、延迟与故障点。Voice Agent Builder将三个阶段紧密耦合至单一模型,减少跳转开销。该工具旨在优化实时语音交互体验。AI产品Grok VoiceVoice Agent BuilderxAI推荐理由:xAI把语音转文字、大模型、文字转语音三个环节整合到一个接口里,延迟更低、故障更少,用Grok Voice搞语音交互的可以试试。原文稍后读已读值得跟进有用关注 Grok Voice
01:01官方账号Vercel AI@vercelVercel 宣布其 AI Gateway 新增实时语音和转录能力,开发者可使用 useRealtime、generateSpeech 和 transcribe 三个工具。该功能基于 AI SDK 7 构建,支持实时语音交互、语音合成和语音识别。无需从零搭建基础设施,即可快速为应用加入语音代理功能。AI产品VercelAI Gatewayvoice agents推荐理由:Vercel 把语音代理直接做到 AI Gateway 里了,用 useRealtime 就能接入实时对话,省掉搭服务器。原文稍后读已读值得跟进有用关注 Vercel
17:55Yangyi@Yangyixxxx用户认为FunASR模型在大部分场景下可用,精度偶尔不足。建议套用LLM进行修复,可解决绝大多数问题。其被评价为中国版Whisper中性价比最高的方案。AI模型FunASRASR语音识别推荐理由:有实测用户说FunASR比Whisper更值,精度不够时加个LLM就能补上,做中文语音识别可以试试。原文稍后读已读值得跟进有用关注 FunASR
13:51官方账号Together AI@togethercomputeTogether AI 构建了基于 Parakeet 的语音转文本堆栈,每秒可处理约 302 秒音频,这是 Artificial Analysis 报告中最高速度因子。该堆栈在 Together 平台上运行,通过系统级优化实现低延迟转录。文章由 @FeelTheBeurn 详细拆解了背后的工程工作。AI模型ParakeetTogether AI语音识别推荐理由:Together AI 把 Parakeet 优化到每秒转写 302 秒音频,比别的服务快一大截,想搞语音识别的可以看看这篇系统调优拆解。原文稍后读已读值得跟进有用关注 Parakeet
02:02Jerry Liu@jerryjliu0Karan Goel 团队发布 Sonic-3.5(文本转语音)和 Ink-2(语音转文本)两种流式模型。新架构实现了速度和质量的突破,将两者推向各自类别的榜首。该团队自称是目前唯一同时拥有排名第一的语音输入和输出模型的提供商。AI模型Sonic-3.5Ink-2语音识别推荐理由:Karan Goel 发了两个新模型,Sonic-3.5 做 TTS 排名第一,Ink-2 做 STT 也是第一,说是唯一一家听说都做到顶的。做语音智能体的话看看。原文稍后读已读值得跟进有用关注 Sonic-3.5
13:55官方账号arXiv cs.AI@Xinxin Li, Huiyao Chen, Meishan Zhang, Yunxin Li, Zulong Chen, Zhibo Ren, Xiaoqing Dong Baotian Hu, Min Zhang传统ASR纠错仅关注孤立语句或短上下文,但在长文本与语音交错的对话中,需要对话级上下文证据。现有方法依赖当前假设或拼接原始对话历史,难以在冗余噪声中定位稀疏纠错证据。本文提出本体记忆增强的ASR纠错框架,将交互历史组织为动态更新的本体记忆,存储实体、术语、表面变体、潜在ASR混淆及语义关系作为可检索节点。基于MAGIC-RAMC构建的RAMC-Corr数据集实验显示,该方法在10个配对骨干设置组合中9个优于直接纠错,促进更选择性、基于证据的上下文相关ASR错误纠正。论文ASR纠错本体记忆长对话推荐理由:做语音识别或对话系统的团队,这个框架解决了长对话中ASR纠错缺乏上下文的问题,直接提升纠错准确率,值得在长交互场景中尝试。原文稍后读已读值得跟进有用关注 ASR纠错
13:08官方账号Guillaume Lample (Mistral)@GuillaumeLampleMistral 发布了 Voxtral 2,包含两个新模型:Voxtral Realtime(实时转录,延迟可低于 200 毫秒,Apache 2 许可)和 Voxtral Mini Transcribe 2(支持说话人分离、词级时间戳和上下文偏置)。该模型支持 13 种语言,通过 Mistral API 提供,是市场上性价比最高的转录 API 之一。AI模型MistralVoxtral 2语音识别推荐理由:做语音转录或实时字幕的开发者终于有了一个开源且低延迟的选择——Voxtral Realtime 的 Apache 2 许可和 sub-200ms 延迟值得一试。原文稍后读已读值得跟进有用关注 Mistral
17:03官方一手marktechpost@Asif Razzaq精选微软 AI 发布了其自研语音转文字模型 MAI-Transcribe-1.5,这是该系列的第二代。该模型支持 43 种语言,在 Artificial Analysis 排行榜上词错误率低至 2.4%,在 FLEURS 基准测试中达到最佳精度。它引入了关键词(实体)偏置功能,可针对特定领域术语提升识别准确率。长音频转录速度提升高达 5 倍,1 小时音频可在 15 秒内完成转录。该模型已在 Azure AI Foundry 中正式可用。AI模型语音识别微软MAI-Transcribe-1.5推荐理由:语音转文字场景的开发者终于有了微软官方的强力选项——MAI-Transcribe-1.5 在精度和速度上双双突破,做会议转录、客服质检或多语言内容处理的团队可以直接在 Azure 上试用,省去自建模型的麻烦。原文稍后读已读值得跟进有用关注 语音识别
15:55官方一手marktechpost@Asif Razzaq精选NVIDIA发布了Nemotron 3.5 ASR,一个600M参数的流式语音识别模型。该模型采用cache-aware架构,可从单个检查点实时转录40种语言-区域。它针对低延迟场景优化,支持多种语言的实时语音转文字。AI模型Nemotron 3.5 ASRNVIDIA语音识别10 个信源在谈事件专题推荐理由:600M模型转40语言实时原文稍后读已读值得跟进有用关注 Nemotron 3.5 ASR
21:46官方账号Together AI@togethercomputeTogether AI 宣布在其平台上推出两款 NVIDIA Nemotron 模型:Nemotron 3 Ultra 专为高吞吐量的智能体工作负载设计,适合构建编码智能体和深度研究智能体;Nemotron 3.5 ASR 则专注于低延迟的多语言语音识别,适用于实时语音系统。这为 AI 原生开发者提供了在 AI Native Cloud 上构建复杂应用的新选择,降低了部署门槛。AI产品NVIDIA NemotronTogether AI智能体10 个信源在谈事件专题推荐理由:做智能体或语音应用的开发者现在有了更专业的模型选择——Nemotron 3 Ultra 适合高并发任务,Nemotron 3.5 ASR 能直接用于多语言实时语音场景,值得在 Together AI 上试试。原文稍后读已读值得跟进有用关注 NVIDIA Nemotron
22:32官方一手Hugging Face: Blog(博客/媒体)NVIDIA 发布了 Nemotron 3.5 ASR 模型的微调指南,帮助开发者将通用语音识别模型适配到特定语言、专业领域或口音。该模型基于 Whisper 架构优化,支持低资源语言和噪声环境。指南提供了从数据准备、训练配置到部署的完整流程,并强调使用 LoRA 等高效微调方法降低计算成本。这对于需要高精度语音识别的垂直场景(如医疗、金融、客服)尤其有价值。AI模型语音识别ASRNemotron10 个信源在谈事件专题推荐理由:NVIDIA 把 ASR 微调的门槛降下来了,做语音应用的团队(尤其是非英语场景或专业领域)可以直接参考这套流程,省去大量试错成本。原文稍后读已读值得跟进有用关注 语音识别
10:25官方账号arXiv cs.AI@Máté Gedeon, Péter Mihajlik低资源语言和垂直领域的对话式语音识别受限于多说话人训练数据稀缺。研究者提出一种数据增强流水线:先由LLM生成带参与者元数据的场景级对话,再将说话人属性映射到TTS语音配置,最后组装成说话人感知的合成对话。在匈牙利语BEA-Dialogue基准上,仅用67小时真实对话加636小时合成数据训练的模型,性能超过用2700小时真实语音训练的零样本模型。该方法适用于任何语言,且LLM生成器选择和合成数据组成对效果影响显著。论文语音识别数据增强低资源语言推荐理由:低资源语言ASR团队终于有了可落地的数据增强方案——用LLM+TTS生成对话数据,效果堪比数倍真实数据。做多说话人语音识别的开发者值得一试,尤其适合匈牙利语等小语种场景。原文稍后读已读值得跟进有用关注 语音识别
10:01官方一手arXiv: OpenAI@Muhammad Ali精选巴尔蒂语(Balti)是巴基斯坦吉尔吉特-巴尔蒂斯坦地区的一种藏语方言,此前没有任何公开的自动语音识别(ASR)资源。研究者构建了名为BaltiVoice的16.8小时朗读语音语料库,包含10060条经过验证的本地纳斯塔利克文字发音,数据源自Mozilla Common Voice录音。他们基于OpenAI Whisper-small模型进行微调,在538条验证集上实现了30.07%的词错误率(WER),而零样本基线高达182.18%。该语料库、微调模型及实时转录演示已公开发布在HuggingFace上,为低资源语言的语音技术发展提供了重要基础。论文语音识别低资源语言Whisper微调3 个信源在谈事件专题推荐理由:这是首个为巴尔蒂语打造的ASR系统,解决了低资源语言语音识别的空白,做多语言语音技术或濒危语言保护的团队可以直接用这个开源模型和语料库。原文稍后读已读值得跟进有用关注 语音识别
08:25OpenRouter@OpenRouterAIOpenRouter 宣布上线微软三款新 AI 模型:MAI-Image-2.5(图像生成)、MAI-Transcribe-1.5(语音转文字)和 MAI-Voice-2(语音合成)。这些模型通过 OpenRouter 平台可直接调用,降低了开发者使用微软最新 AI 能力的门槛。此举意味着开发者无需单独申请 Azure 权限,即可在统一 API 下体验微软的多模态模型。对于需要图像生成、语音识别或语音合成的团队,这是一个便捷的新选择。AI产品微软OpenRouter图像生成5 个信源在谈事件专题推荐理由:微软的多模态模型终于能在 OpenRouter 上直接调用了,做图像生成、语音转文字或语音合成的开发者可以省去 Azure 申请流程,直接上手试。原文稍后读已读值得跟进有用关注 微软
10:46官方账号arXiv cs.AI@Máté Gedeon, Piroska Zsófia Barta, Péter Mihajlik, Katalin Mády精选匈牙利语对话自动语音识别(ASR)因公开对话式训练数据有限而受限。BEA-Dialogue 语料库虽填补了空白,但其严格的说话人分离划分导致可用数据仅85小时。本文提出扩展版 BEA-Dialogue+,放宽划分标准,保留主要说话人完全分离,将可用数据增至200小时。研究评估了 Whisper 和 FastConformer 模型,发现更大语料库对未微调模型更具挑战性,而基于序列化输出训练(SOT)的微调在词错误率、字符错误率等指标上持续提升。该语料库为匈牙利语对话 ASR 提供了更大且更具挑战性的基准。论文语音识别匈牙利语对话语料库推荐理由:匈牙利语 ASR 研究者终于有了更大规模的对话数据集——BEA-Dialogue+ 将可用训练数据从85小时扩展到200小时,做低资源语言语音识别的团队可以直接用于模型评估和微调。原文稍后读已读值得跟进有用关注 语音识别
11:34官方账号arXiv cs.LG@Berk Hayta, Hannah Laus, Simon Mittermaier, Felix Krahmer精选证据深度学习(EDL)通过狄利克雷分布实现单次前向传播的不确定性估计,但其损失函数复杂,难以分析和实现。本文提出一种插件损失(plug-in loss),在狄利克雷均值处评估标准损失(如交叉熵),并证明在温和假设下近似误差随证据增长而衰减。该框架将标准 Softmax 分类器纳入不确定性估计,简化了实现。在 Google Speech Commands 数据集上,该方法在预测准确率和选择性预测性能上与经典 EDL 相当,且更易集成到现有训练流程。这是首次在语音识别任务中通过 EDL 获得覆盖-准确率权衡的实证分析。论文不确定性估计证据深度学习Softmax推荐理由:做不确定性估计的团队终于有了更简单的实现路径——用标准 Softmax 损失就能获得 EDL 效果,语音识别研究者可以直接替换现有训练流程试试。原文稍后读已读值得跟进有用关注 不确定性估计
06:11IT之家(博客/媒体)苹果在博文中预告iOS 27将新增“生成字幕”辅助功能,支持系统级实时为无字幕视频自动生成字幕。该功能依赖设备端语音识别,音频数据完全本地处理,不上传云端。首发版本仅支持英语,面向美国和加拿大用户,后续预计扩展语言和地区。除iPhone外,还覆盖iPad、Mac、Apple TV和Vision Pro,实现跨设备体验统一。AI产品iOS 27苹果自动字幕推荐理由:苹果让视频自动加字幕了原文稍后读已读值得跟进有用关注 iOS 27
17:35官方账号阿里云 Alibaba Cloud@alibaba_cloud阿里云在澳门举办AI赋能工作坊,展示了粤语语音识别、行政审批加速和智慧医疗等本地化解决方案。这些方案旨在解决澳门本地的具体问题,如提升公共服务效率。工作坊强调了AI在本地化场景中的实际价值,而非通用技术。阿里云通过ISV合作模式,推动AI在澳门各行业的落地应用。行业AI应用语音识别行政效率推荐理由:该活动展示了AI在特定地域(澳门)的落地实践,对关注AI本地化和行业应用的企业有参考价值。原文稍后读已读值得跟进有用关注 AI应用