10:44官方账号arXiv cs.LG@Xin Wang, Yingchao Huang, Yuhan Su, Shanshan Yao, Wei Peng研究提出LSEAD框架,使用预训练开源大语言模型对语音录音自动转录并提取文本嵌入,再通过主成分分析降维后进行分类。该方法仅依赖本地部署的模型和语音转录文本,无需外部数据交换,支持隐私保护的AD风险评估。在ADReSS20和ADReSSo2021基准数据集上,LLM嵌入相比现有方法将AD分类准确率最高提升5%,尤其对早期检测效果显著。论文LSEAD阿尔茨海默病语音分析推荐理由:这个框架直接用开源LLM做语音筛查,不用联网传数据,保护隐私,在ADReSS20和ADReSSo2021上还比现有方法最高涨5个点,适合做早期阿尔茨海默病筛查研究的人看。原文稍后读已读值得跟进有用关注 LSEAD
09:34官方账号arXiv cs.LG@Ranveer Singh, Pranuthi Tenali, Saurabh Mathur, Ameet Soni, Vaishali Phatak, Karla Lynch, Daniel Murman, Matthew Rizzo, Sriraam Natarajan该研究提出一种自动化流程,直接从语言流畅性测试的音频中提取阿尔茨海默病进展指标。方法使用预训练基础模型处理原始音频,构建贝叶斯网络进行推理,并解释各语言标记间的定性关系。系统成功恢复了已知的临床知识,还发现了新的语言学标记关联。相关论文已发布在arXiv上。论文Alzheimer's DiseaseBayesian Network神经符号推荐理由:不用手动转录音频,自动从语音里挖出阿尔茨海默病早期信号,还能解释推理过程,比黑盒模型更让人放心。原文稍后读已读值得跟进有用关注 Alzheimer's Disease
11:52官方账号arXiv cs.LG@Yingchao Huang, Xin Wang, Yuhan Su, Shanshan Yao研究提出基于开源LLM的多模态认知障碍检测框架,融合语音音频和转录文本。在ADReSS20和ADReSSo21基准上评估,分类准确率达92.4%。该框架优于单模态基线,并展现出跨数据集泛化能力。无需访问原始敏感数据,保护患者隐私。论文ADReSS20ADReSSo21LLM推荐理由:这篇论文用开源LLM整合语音和文本,在ADReSS20上准确率92.4%,比只用单一模态强多了,且跨数据库也能用。原文稍后读已读值得跟进有用关注 ADReSS20
10:03官方账号arXiv cs.LG@Hanna Drimalla, Wieland R. Cremer, Christine Kraus, Oliver T. Wolf本研究从50名参与者的语音数据中,利用说话人分离和机器学习模型,实现了对Trier Social Stress Test情境下压力状态的自动检测,性能显著高于均值基线。同时,部分生理和情感压力反应可从声学韵律特征中预测,特征重要性分析识别出最关键的预测因子。结论表明语音可作为压力反应的多维度无侵入式指标。论文Trier Social Stress Test压力检测语音分析推荐理由:这篇论文用50人的实验数据,结合说话人分离和机器学习,证明了语音能有效检测压力,还找出了关键声学特征,挺有意思的研究。原文稍后读已读值得跟进有用关注 Trier Social Stress Test
06:16Ate-a-Pi@svpino开发者 Santiago 在构建语音管道时发现,传统方法将音频转为文本后丢失了语气、犹豫、讽刺等关键信息。Modulate AI 的 Velma 模型直接处理原始音频,无需转录,能检测多达 150 种隐形线索,已在《使命召唤》和《GTA Online》中用于实时检测毒性言论。Velma 通过 API 提供,成本比通过 LLM 处理音频低约 10 倍。该模型解决了语音分析中语义与情感分离的痛点,适合需要深度理解语音意图的团队。AI产品语音分析Modulate AIVelma推荐理由:做语音分析或实时内容审核的开发者,Velma 直接跳过转录环节,成本低且能捕捉语气情绪,值得一试。原文稍后读已读值得跟进有用关注 语音分析
19:12官方一手arXiv: DeepSeek@Erfan Loweimi, Sofia de la Fuente Garcia, Saturnino Luz精选研究团队利用大语言模型(LLM)从自发语音中零样本预测Ryff心理幸福感(PWB)分数。基于PsyVoiD数据库中111名参与者的几分钟语音录音,评估了12种指令微调LLM(包括Llama-3、Ministral、Mistral、Gemma-2/3、Phi-4、DeepSeek和QwQ-Preview)。与临床心理学和语言学专家合作开发了领域提示词。结果显示,LLM能从语音中提取语义线索,在80%的数据上达到最高0.8的Spearman相关性。研究还通过统计分析解释预测变异性和偏差,并用词云突出驱动预测的语言特征。论文LLM心理幸福感语音分析推荐理由:这项研究为心理健康评估提供了非侵入式新方法——用几分钟语音就能预测幸福感,做临床心理学或语音分析的团队值得关注,零样本方案降低了部署门槛。原文稍后读已读值得跟进有用关注 LLM