12:19官方账号arXiv cs.AI@Arya Labroo, Mengjie Qian, Kate Knill该研究将概念激活向量(CAV)方法扩展至基于BERT的文本评分器和基于Whisper的多模态语音文本评分器,用于检测L2口语评估中因母语或年龄等无关属性产生的偏差。CAV通过激活空间方向表示概念,并用梯度敏感度区分概念是否被编码及是否影响分数。研究发现概念的可恢复性主要取决于模型表示和架构,而非概念本身。稀疏自编码器(SAE)虽使概念更线性可恢复,但会削弱原始激活空间的敏感度,尤其在低维层。论文Concept Activation VectorsBERTWhisper推荐理由:这篇论文教你怎么用CAV和稀疏自编码器查口语评分模型有没有偏袒某类考生,结果发现模型架构影响很大,别光看概念能不能被提取出来。原文稍后读已读值得跟进有用关注 Concept Activation Vectors
17:08Viking@vikingmute作者遇到一个很长的 bug 录屏,不想手动看完,于是尝试了一个开源 skills。流程用 yt-dlp 下载视频,优先获取平台自带字幕,缺失时用 MLX-Whisper 或 whisper.cpp 转录。需要视觉信息时,用 ffmpeg 按场景抽帧,把帧和对应时间段的转录一起发给 Agent。最终生成 moments.md 和 summary.md,作者借此快速定位 bug 细节,并转给其他 Agent 修复。技巧yt-dlpWhisperffmpeg推荐理由:vikingmute 分享的 skills,让 Agent 自动看视频,yt-dlp 下载、Whisper 转录、ffmpeg 抽帧,处理长录屏省事。原文稍后读已读值得跟进有用关注 yt-dlp
02:28官方一手@OpenAIDevs@OpenAIDevs精选GPT-Transcribe 在 Context Aware ASR 基准上,语义准确率从无自由格式上下文时的 41.6% 提升至 45.2%。在 Common Voice 的 22 种语言上,GPT-Transcribe 转录错误率为 19.27%,而 Whisper(whisper-1)为 40.37%。在 Real-World Audio Recording 基准的 9 种语言上,GPT-Transcribe 错误率为 8.98%,Whisper 为 15.21%。AI模型GPT-TranscribeWhisperASR推荐理由:OpenAI 发的 GPT-Transcribe 在音频转录上比 Whisper 错误率低一半,多语言场景提升明显。原文稍后读已读值得跟进有用关注 GPT-Transcribe
09:49官方账号arXiv cs.LG@Ganapati Das, Dwipen Laskar, Hasin Afzal Ahmed, Sanjib Kr Kalita, Kshirod Sarmah, Hem Chandra Das, Manjula Kalita该论文提出基于Whisper模型的阿萨姆语ASR系统,在Mozilla Common Voice 24.0-Assamese语料库上微调,采用混合精度训练和梯度累积优化资源受限环境。微调后词错误率(WER)降至43.17%,字符错误率(CER)13.18%,与零样本基线相比分别相对提升78.26%和93.10%。语义评估BLEU得分为30.81,METEOR为0.5262,幻觉率降低96.70%,实时因子(RTF)改善32.38%。论文WhisperAssameseASR推荐理由:这篇论文告诉你如何微调Whisper搞定低资源语言阿萨姆语的语音识别,效果比零样本好一大截,WER直接降了78%原文稍后读已读值得跟进有用关注 Whisper
16:06宝玉@dotey精选OpenMOSS 开源了 MOSS-Transcribe-Diarize-0.9B 模型,参数规模 0.9B,支持 128K 上下文,最长可一次处理约 90 分钟音频。该模型采用 Whisper-Medium 编码器 + Qwen3-0.6B 风格 decoder,端到端完成转写、说话人分离和时间对齐,无需级联流程。在单张 4090 显卡上,RTF 为 0.017,5-10 分钟录音约 30 秒转完,并支持热词增强。模型以 Apache 2.0 协议开源,可商用。AI模型OpenMOSSMOSS-Transcribe-Diarize-0.9BWhisper推荐理由:OpenMOSS 开源了一个 0.9B 参数的端到端模型,能一次搞定 90 分钟多人音频,告诉你谁说了什么、什么时候说的,单卡 4090 跑得飞快。原文稍后读已读值得跟进有用关注 OpenMOSS
15:21宝玉@dotey精选Whisper 在字幕翻译中存在时间戳不准、中英文混排支持差、不直接支持发言人识别等问题。Qwen3-0.6b ASR 搭配 Qwen3-ForcedAligner 模型可精准对齐词级时间戳,本地运行资源占用低。发言人识别可使用 Pyannote + WeSpeaker 开源模型,结合 Agent 上下文提升准确率。若要求高,可选用火山引擎豆包录音文件识别模型 2.0。宝玉在 BaoCut App 开发中,通过 Claude Code 和 Opus 4.8 等模型实现原型设计到功能实现的高效循环。技巧Qwen3WhisperASR推荐理由:宝玉分享了用 Qwen3 ASR 替代 Whisper 做字幕的心得,时间戳对得很准,还配了发言人识别方案,适合搞视频翻译的朋友。原文稍后读已读值得跟进有用关注 Qwen3
11:33官方账号arXiv cs.AI@Harsha Vardhan Khurdula, Abhinav Kumar Singh, Yoeven D Khemlani, Vineet Agarwal本文提出用离散扩散语言模型DiffusionGemma(26B MoE)替代自回归解码器进行语音识别。方法冻结Whisper编码器提取声学特征,通过轻量投影器和低秩适配器将音频映射到模型空间,仅训练约42M参数(占0.16%)。研究发现自然训练目标梯度无法有效传递,引入连接主义时序分类(CTC)损失后成功训练。在LibriSpeech test-clean上达到6.6%词错误率,并行解码仅需8步且与语速无关,单适配器训练六种语言(评估了英语、印地语和普通话)。论文DiffusionGemmaWhisperLibriSpeech推荐理由:这个研究用DiffusionGemma做语音识别,并行解码8步就达到6.6%错误率,只训练了0.16%的参数,挺高效的。原文稍后读已读值得跟进有用关注 DiffusionGemma
09:44IT之家(博客/媒体)MacWhisper 14.0 更新新增编辑器视图,用户可直接在转录界面编辑、添加段落、重新分配发言人。该版本修复了 CPU 空闲占用率过高问题,并改进了多个录音同时打开时的播放效果。更新还重新设计了 AI 服务界面,为 Deepgram 等提供商更新模型并扩展 Nova 3 语言支持。官方同步推出 14.1 版本,新增 Gladia 作为云转录提供商。AI产品MacWhisperWhisperNvidia Parakeet推荐理由:MacWhisper 14 新增编辑器视图,能直接改转录稿,CPU占用也降了,转录更顺滑,推荐播客制作者升级。原文稍后读已读值得跟进有用关注 MacWhisper
11:46官方一手arXiv: OpenAI@Sheng Li, Jing Li, Felix Schijve, Jun Hu, Emilia Barakova本文综述了自动语音识别(ASR)在机器人系统中的集成方法,涵盖在线API和本地模型两种方案。重点分析了从传统方法到OpenAI Whisper等深度学习模型的演变,并列举了LibriSpeech、Common Voice等大规模数据集以及Kaldi、ESPnet等开源工具包。系统梳理了基于ROS、云服务和混合架构的部署策略,以及Pepper、NAO等真实机器人平台的应用案例。最后探讨了在动态嘈杂环境中实现多模态交互的挑战,为社交机器人研究者提供了语言交互领域的导航。论文WhisperROS语音识别7 个信源在谈事件专题推荐理由:这篇综述把机器人语音识别的在线API和本地模型方案都讲透了,尤其适合想用Whisper做离线识别的开发者,ROS集成部分很有实操参考。原文稍后读已读值得跟进有用关注 Whisper
02:40官方一手marktechpost@Sana Hassan精选本教程演示如何搭建一个无需API密钥的多智能体视频编辑流水线,包含意图解析器、智能体库、工具路由器(连接FFmpeg、Whisper语音转写、场景检测等8个组件)以及图规划器,并引入文本梯度优化器自动修复执行图。最终系统能根据自然语言指令回答视频内容问题、生成摘要并产出编辑产物。所有组件均基于开源工具实现,不依赖外部商业服务。技巧VideoAgentFFmpegWhisper推荐理由:手把手教你用FFmpeg+Whisper搭视频编辑Agent,不用API密钥,还能自动修复执行图,比纯AI工具更可控。原文稍后读已读值得跟进有用关注 VideoAgent
02:09官方账号Decoder@Matthias BastianCohere发布了开源模型Transcribe Arabic,拥有20亿参数,专为阿拉伯语方言、代码切换和阿拉伯语-英语双语语音识别优化。该模型在多项测试中性能超过Whisper和OmniASR。模型已上传至Hugging Face,采用Apache 2.0许可证。AI模型CohereTranscribe ArabicWhisper推荐理由:Cohere搞了个阿拉伯语语音模型,20亿参数,专门对付方言和双语,据说比Whisper还牛,搞语音识别的快试试。原文稍后读已读值得跟进有用关注 Cohere
12:28官方账号arXiv cs.AI@Sathvik Manikantan Napa Ugandhar, Hao Zhang, Alison Gunzler, Yuzhe Wang, Thomas Thebaud, Georgi Tinchev, Venkatesh Ravichandran, Laureano Moro-Velázquez论文提出DyadEE数据集,包含真实情感协调对话和通过交换伴侣、情感重合成制造的干扰对话。同时提出TRACE框架,将双人交互建模为基于情感微调Whisper声学嵌入的有序序列,将每个样本视为交互痕迹而非池化话语。在DyadEE上实验表明,融入对话上下文和关系信息可提升检测效果,TRACE达到97.01%的准确率。论文TRACEDyadEEWhisper推荐理由:想研究语音AI如何感知对话中的情感协调?这篇论文提出了新数据集DyadEE和框架TRACE,准确率高达97%,值得做语音交互的朋友看看。原文稍后读已读值得跟进有用关注 TRACE
11:12官方账号arXiv cs.AI@Ravi Ranjan, Utkarsh Grover, Xiaomin Lin, Agoritsa PolyzouTransformer ASR模型如Whisper预测难解释。LEAF-X框架结合熵引导注意力加权、多层注意力展开和因果消融,定位低熵高影响头与层,生成稀疏token-帧归因。相比扰动解释器或原始注意力图,LEAF-X更好反映模型计算,忠诚度提升32%,局部性/稀疏性增强35-39%,归因最稳定。论文WhisperLEAF-X可解释性推荐理由:Whisper解释性更好用了原文稍后读已读值得跟进有用关注 Whisper
10:01官方一手arXiv: OpenAI@Nikhil Vincent精选CoughSense 是一个利用智能手机录音自动分类五种呼吸系统疾病(健康、COVID-19、哮喘、支气管炎、肺炎)的系统。它基于 OpenAI Whisper 编码器微调,并引入主动帧 QKV 注意力池化(Active-frame QKV attention pooling),解决了 Whisper 30秒输入窗口内短咳嗽信号被静音稀释的问题。系统还通过加权采样、数据增强、平衡混合、对比学习、症状条件化和域自适应等技术,处理了19:1的类别不平衡和跨数据集域偏移。在四个公开数据集共18,301条录音上,CoughSense(Whisper-tiny,8.6M参数)达到82.3%的平衡准确率,双编码器融合版本达到85.4%。主动帧池化是最大的单一贡献模块(提升5.1个点),对任何使用Whisper的短音频任务都有参考价值。论文Whisper呼吸疾病分类咳嗽分析1 个信源在谈事件专题推荐理由:做呼吸疾病音频诊断或短音频分类的团队,可以直接借鉴CoughSense的主动帧池化和域自适应方案,解决Whisper在短信号上的静音稀释痛点。原文稍后读已读值得跟进有用关注 Whisper
10:46官方账号arXiv cs.AI@Máté Gedeon, Piroska Zsófia Barta, Péter Mihajlik, Katalin Mády精选匈牙利语对话自动语音识别(ASR)因公开对话式训练数据有限而受限。BEA-Dialogue 语料库虽填补了空白,但其严格的说话人分离划分导致可用数据仅85小时。本文提出扩展版 BEA-Dialogue+,放宽划分标准,保留主要说话人完全分离,将可用数据增至200小时。研究评估了 Whisper 和 FastConformer 模型,发现更大语料库对未微调模型更具挑战性,而基于序列化输出训练(SOT)的微调在词错误率、字符错误率等指标上持续提升。该语料库为匈牙利语对话 ASR 提供了更大且更具挑战性的基准。论文语音识别匈牙利语对话语料库推荐理由:匈牙利语 ASR 研究者终于有了更大规模的对话数据集——BEA-Dialogue+ 将可用训练数据从85小时扩展到200小时,做低资源语言语音识别的团队可以直接用于模型评估和微调。原文稍后读已读值得跟进有用关注 语音识别
18:29Qdrant@qdrant_engine大多数车载媒体系统仍依赖关键词搜索,但驾驶时用户更倾向于用情绪、氛围和意图来寻找音乐。Sarvesh Talele 基于 Qdrant Edge 构建了一个完全本地化的 AI 媒体发现系统,支持语音、文本和情绪查询。该系统利用 Whisper 进行本地语音转录,通过向量嵌入实现语义检索,并使用 Qdrant Edge 在设备端完成向量搜索,无需依赖云端。这一项目展示了向量搜索如何在保护隐私的前提下,为车载场景提供实时、个性化的体验。AI产品语义搜索车载系统Qdrant Edge推荐理由:车载媒体搜索终于从关键词进化到语义理解,做车载系统或本地 AI 应用的开发者可以直接参考这个架构,体验隐私优先的实时搜索。原文稍后读已读值得跟进有用关注 语义搜索
21:04宝玉@dotey精选博主dotey分享了利用AI或Agent制作字幕SRT的经验,强调断句和拼写纠错是关键。英文断句简单,通过标点即可切分;中文断句更复杂,因为Whisper生成的中文语音没有标点,且“word”是多个汉字。需要借助大模型断句加标点,再重新对齐时间戳拆分。对于长访谈,需分块处理,避免切分在句子中间。推荐Mac用户使用WhisperKit,支持单词级时间戳和说话人识别。技巧字幕SRT断句Whisper推荐理由:做字幕或视频处理的开发者,用AI断句和纠错能大幅提升效率,中文断句的坑和解决方案都讲清楚了,值得实操参考。原文稍后读已读值得跟进有用关注 字幕SRT