论文11:51AMR:面向多模态多语言说话人识别的自适应模态路由这篇用AMR动态融合音视频特征,缺失模态也能准确识别说话人。在POLY-SIM上平均99%准确率,比基线高32%,很实用。#W2V-BERT 2.0#IResNet-18#AMR#多模态aarXiv cs.LG@Chuxiao Zuo 等 6 人原文稍后读已读值得跟进有用关注 W2V-BERT 2.0