AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

多模态融合

共 6 条相关 AI 资讯
8月18日
15:36
15:36官方账号arXiv cs.AI@Bo Zhao, Zheng Wu, Yiping Xie, Zitong YU
CardiacMamba是一个融合RGB面部视频与射频(RF)心脏运动信号的rPPG框架,通过状态空间建模提升心率估计的公平性与鲁棒性。其引入时间差分Mamba模块(TDMM)增强RF信号细微变化,双向SSM交互机制对齐异构模态,通道级FFT(CFFT)优化频谱特征。在EquiPleth数据集上,CardiacMamba取得0.96 bpm MAE、3.06 bpm RMSE和0.97皮尔逊相关系数,将浅深肤色MAE差距降至0.26 bpm,并在RGB退化或RF缺失时保持稳健。
论文CardiacMambarPPG心率估计

推荐理由:想搞非接触心率监测的可以看看,它把RGB和射频信号融合,肤色偏见和光照干扰都压下去了,EquiPleth上误差不到1 bpm。
原文
8月11日
12:38
12:38官方账号arXiv cs.LG@Samaneh Rezaeimanesh, Mohsen Behradfar, Mohammad Fili, Guiping Hu
Child Mind Institute使用Helios腕戴设备收集数据,结合惯性测量单元、热电堆传感器和飞行时间传感器,捕捉运动、热感和距离信息。研究团队开发了结合卷积神经网络和门控循环单元的深度学习框架,并加入模态专用自编码器和晚期融合分类器。该框架在二元检测中F1分数达0.985,AUC为0.997,九类分类中宏平均F1为0.700,AUC为0.963。Shapley解释显示飞行时间和惯性模态主导判别力,层级聚类表明误分类主要由手势解剖区域驱动。研究证明多模态融合可实现准确、客观、连续的行为监测,为可穿戴辅助心理健康诊断奠定基础。
论文多模态融合可穿戴设备深度学习

推荐理由:这个研究用腕带传感器加深度学习,检测拔毛、抠皮这类小动作,F1到0.985,比单模态准多了,对心理健康监测挺有参考价值。
原文
7月29日
09:25
09:25官方账号arXiv cs.LG@Shiyu Teng, Haichen Yu, Jiaqing Liu, Hao Sun, Yu Song, Shurong Chai, Ruibo Hou, Lanfen Lin, Yen-Wei Chen
DynaBridge是一种动态摘要引导的跨任务多模态融合框架,用于基于DASS-21结构的抑郁、焦虑和压力评估。该模型编码多个会话中的声学、视觉和文本线索,并利用冻结LLM生成DASS感知的参与者级语义摘要。它预测有序项目分布,从项目级软评分重建抑郁/焦虑/压力风险证据,并与直接多模态风险预测融合。在AdoDAS验证集上,DynaBridge实现了0.5012的平均F1分数(D/A/S风险预测)和0.3216的平均QWK(DASS-21项目预测),优于官方基线和其他代表性多模态方法。
AI模型DynaBridge多模态融合DASS-21

推荐理由:新框架DynaBridge用多模态数据和语义摘要预测抑郁焦虑压力,在AdoDAS上F1达0.5,比基线强。
原文
7月14日
12:25
12:25官方账号arXiv cs.AI@Divya Mereddy, Jeevan Beedareddy
该论文提出一种基于低秩适配(LoRA)的级联多模态融合框架,用于医疗培训环境中的动作识别。框架先整合相关性高的模态(如RGB、骨骼),再逐步加入异质模态(如音频),无需重新训练先前组件。在NurViD和Nurse Training两个数据集上评估,级联融合策略优于单模态模型,与先前报告的数据集特定基线(如基于Transformer的方法)性能相当。代码已在GitHub开源。
论文LoRA多模态融合动作识别

推荐理由:想用LoRA做多模态融合?这篇用级联方式逐步整合不同模态,在医疗动作识别上效果不错,还开源了代码,可以看看。
原文
5月21日
11:31
11:31官方账号arXiv cs.AI@Junghyun Lee, Hyunseo Kim, Hanna Jang, Junhyug Noh
精选
本文提出了一种基于排序感知的选择性融合框架,用于解决混合情感识别中多模态线索重叠的挑战。该方法通过注意力门控模块估计每个编码器的重要性,仅融合最有效的 top-n 编码器,并解耦预测为存在性和显著性两个头部。在 BlEmoRE 挑战中,该框架超越了强个体编码器和朴素多编码器融合基线,最终获得第二名。这项工作展示了排序感知融合在细粒度混合情感识别中的有效性。
论文混合情感识别多模态融合排序感知

推荐理由:混合情感识别是多模态 AI 的难点,这个排序感知融合框架解决了编码器选择问题,做情感计算或多模态融合的团队可以直接参考其方法。
原文
5月19日
11:02
11:02官方账号arXiv cs.LG@Robson W. S. Pessoa, Julien Amblard, Alessandra Russo, Idelfonso B. R. Nogueira
精选
UTOPYA是一个1520万参数的多模态框架,通过融合八种数据模态,解决了批处理过程中的异常检测难题。该框架采用特征线性调制(FiLM)条件跨模态注意力和门控融合,并引入物理信息正则化方案,强制时间平滑和热力学单调性。在119实验的多模态批处理蒸馏数据集上,UTOPYA在窗口级测试AUROC达到0.832,多信号实验级AUROC达到0.874,显著优于PCA、自编码器、孤立森林和LSTM自编码器等基线方法。消融实验表明,FiLM条件提供的静态上下文是关键因素,将实验级多信号AUROC从0.729提升至0.874。同时,研究揭示了实例归一化、Mixup、集成、测试时增强和随机权重平均等常用技术在此数据稀缺场景下反而会降低泛化性能。
论文异常检测多模态融合物理信息网络

推荐理由:UTOPYA为工业过程监控提供了首个融合物理信息与多模态数据的端到端方案,做异常检测和过程控制的工程师可以直接参考其架构设计,尤其适合数据稀缺场景下的部署决策。
原文
精选全部日报登录