8月26日
10:27
10:27官方账号arXiv cs.LG@Muhammad Asad Ali, Umar Khan, Nadia Robertini, Didier Stricker
MoTE(混合任务专家)是一种解码器架构,将大型语言模型的正向网络转换为特定任务的专家,同时保持多模态骨干共享。在五个COIN基准上评估,该模型在VideoLLM-MoTE上实现了比最近的VideoLLM基线更高的平均top-1准确率。
推荐理由:MoTE模型在多任务视频语言学习方面提供了可解释且计算高效的解码器替代方案,值得一看。