8月10日
10:44
10:44官方账号arXiv cs.LG@Xin Wang, Yingchao Huang, Yuhan Su, Shanshan Yao, Wei Peng
研究提出LSEAD框架,使用预训练开源大语言模型对语音录音自动转录并提取文本嵌入,再通过主成分分析降维后进行分类。该方法仅依赖本地部署的模型和语音转录文本,无需外部数据交换,支持隐私保护的AD风险评估。在ADReSS20和ADReSSo2021基准数据集上,LLM嵌入相比现有方法将AD分类准确率最高提升5%,尤其对早期检测效果显著。
推荐理由:这个框架直接用开源LLM做语音筛查,不用联网传数据,保护隐私,在ADReSS20和ADReSSo2021上还比现有方法最高涨5个点,适合做早期阿尔茨海默病筛查研究的人看。
8月3日
09:34
09:34官方账号arXiv cs.LG@Ranveer Singh, Pranuthi Tenali, Saurabh Mathur, Ameet Soni, Vaishali Phatak, Karla Lynch, Daniel Murman, Matthew Rizzo, Sriraam Natarajan
该研究提出一种自动化流程,直接从语言流畅性测试的音频中提取阿尔茨海默病进展指标。方法使用预训练基础模型处理原始音频,构建贝叶斯网络进行推理,并解释各语言标记间的定性关系。系统成功恢复了已知的临床知识,还发现了新的语言学标记关联。相关论文已发布在arXiv上。
推荐理由:不用手动转录音频,自动从语音里挖出阿尔茨海默病早期信号,还能解释推理过程,比黑盒模型更让人放心。
7月24日
11:52
11:52官方账号arXiv cs.LG@Yingchao Huang, Xin Wang, Yuhan Su, Shanshan Yao
研究提出基于开源LLM的多模态认知障碍检测框架,融合语音音频和转录文本。在ADReSS20和ADReSSo21基准上评估,分类准确率达92.4%。该框架优于单模态基线,并展现出跨数据集泛化能力。无需访问原始敏感数据,保护患者隐私。
推荐理由:这篇论文用开源LLM整合语音和文本,在ADReSS20上准确率92.4%,比只用单一模态强多了,且跨数据库也能用。
7月2日
10:03
10:03官方账号arXiv cs.LG@Hanna Drimalla, Wieland R. Cremer, Christine Kraus, Oliver T. Wolf
本研究从50名参与者的语音数据中,利用说话人分离和机器学习模型,实现了对Trier Social Stress Test情境下压力状态的自动检测,性能显著高于均值基线。同时,部分生理和情感压力反应可从声学韵律特征中预测,特征重要性分析识别出最关键的预测因子。结论表明语音可作为压力反应的多维度无侵入式指标。
推荐理由:这篇论文用50人的实验数据,结合说话人分离和机器学习,证明了语音能有效检测压力,还找出了关键声学特征,挺有意思的研究。