16:07宝玉@dotey精选宝玉将 OpenMOSS 开源的 MOSS-Transcribe-Diarize-0.9B 集成到剪映工具 BaoCut 中,可直接输出带精确时间戳和说话人标注的结构化转写结果。该模型无需专用发言人识别模型,但转录速度比 Qwen3-ASR-0.6B 慢,且不支持标点符号,自定义 Prompt 与热词也未生效。项目地址为 github.com/OpenMOSS/MOSS-Transcribe-Diarize。AI模型BaoCutOpenMOSSMOSS-Transcribe-Diarize-0.9B推荐理由:宝玉给 BaoCut 集成了 MOSS-Transcribe-Diarize-0.9B,能一次搞定长音频转写和说话人标注,省去额外模型,适合做字幕或会议记录。原文稍后读已读值得跟进有用关注 BaoCut
11:49官方账号arXiv cs.AI@Yuxuan Li, Lingxi Xie, Xinyue Huo, Jihao Qiu, Jiacheng Shao, Pengfei Chen, Jiannan Ge, Kaiwen Duan, Qi Tian研究者发布了DramaSR-532K基准,包含53.2万条带注释对话和900多个角色,需整合听觉、语言和视觉线索。他们提出DramaSR-LRM方法,基于大型推理模型(LRM),通过多模态工具自主聚合上下文证据。在短话语上,DramaSR-LRM显著优于现有基线,因为声学生物特征在这些场景中不可靠。数据和代码将公开。论文DramaSR-532KDramaSR-LRM推理模型推荐理由:一篇论文用推理模型做说话人识别,还建了个53万条对话的新基准,短话识别效果比现有方法强不少。原文稍后读已读值得跟进有用关注 DramaSR-532K
11:51官方账号arXiv cs.LG@Chuxiao Zuo, Yao Zhu, Minqiang Xu, Manhong Wang, Yunke Zhang, Fei Huang提出自适应模态路由(AMR)模块,用于多模态多语言说话人识别。AMR使用W2V-BERT 2.0音频编码器和IResNet-18人脸编码器,通过可训练路由器动态分配模态权重。在POLY-SIM 2026评估集上,系统在4个协议上的平均准确率达99.07%,比FOP基线提升32.73%。具体成绩:英语多模态99.93%,乌尔都语多模态100.00%,英语仅音频97.50%,乌尔都语仅音频98.83%。论文W2V-BERT 2.0IResNet-18AMR推荐理由:这篇用AMR动态融合音视频特征,缺失模态也能准确识别说话人。在POLY-SIM上平均99%准确率,比基线高32%,很实用。原文稍后读已读值得跟进有用关注 W2V-BERT 2.0