10:27官方账号arXiv cs.LG@Muhammad Asad Ali, Umar Khan, Nadia Robertini, Didier StrickerMoTE(混合任务专家)是一种解码器架构,将大型语言模型的正向网络转换为特定任务的专家,同时保持多模态骨干共享。在五个COIN基准上评估,该模型在VideoLLM-MoTE上实现了比最近的VideoLLM基线更高的平均top-1准确率。论文多任务视频理解混合任务专家VideoLLM-MoTE推荐理由:MoTE模型在多任务视频语言学习方面提供了可解释且计算高效的解码器替代方案,值得一看。原文稍后读已读值得跟进有用关注 多任务视频理解