多模态分类中缺失任意模态的协同学习

Co-Learning for Missing Arbitrary Modalities in Multi-modal Classification

精选理由

这篇论文针对多模态分类中模态任意缺失的问题提出了两种具体方法,在单缺失和极缺失场景下各有优势,代码开源可复现。

AI 摘要

该论文提出一种多模态协同学习框架,处理训练与推理时模态不固定的缺失问题,而非传统双模态融合。实验在两种多模态分类基准上,针对任意缺失模态(单模态缺失或仅剩一模态)测试。方法一在单模态缺失时更鲁棒,方法二在极缺失条件下表现更好。代码已开源在GitHub。

原文 · arXiv cs.LG

Co-Learning for Missing Arbitrary Modalities in Multi-modal Classification

Multi-modal classification leverages complementary information across diverse data sources to enhance predictive performance. However, real-world scenarios subject to operational constraints, such as sensor failures or privacy restrictions, lead to inconsistent modality availability between training and inference times. To handle missing modalities, prior studies have mainly covered bimodal data setups and focused on designing robust fusion processes. Instead, we adopt a multi-modal co-learning framework that prioritizes inter-modal collaboration rather than multi-modal fusion. Specifically, we consider that any subset of modalities may be absent, without assuming predefined missing-modality patterns, an inference scenario we refer to as missing arbitrary modalities. To address this challenge, we introduce two alternative approaches that leverage information at both feature- and decision-level. Experiments on two multi-modal classification benchmarks demonstrate significant robustness gains in various missing modality conditions. The first method shows more robust behavior under minimal missing conditions, where a single modality is absent, whereas the second performs better under extreme missing conditions, where all-but-one modalities are missing. Our code is available at https://github.com/fmenat/Co4Miss.

多模态分类中缺失任意模态的协同学习 · AI 热点