18:26官方账号arXiv cs.LG@Changhao Xiang, Shangyu Xing, Zhen Wu, Jianbing Zhang, Xinyu DaiMMCS是一种新的多模态预训练方法,通过将文本实体替换为对应视觉对象,提供显式的对象级监督。该方法仅用50K样本就能匹配或超越在600K图像-文本对上训练的模型,数据效率提升12倍。MMCS在773K样本的预训练数据集上验证了有效性,并持续提升不同规模模型的视觉定位和感知能力。该研究针对现有MLLMs中图像级对齐的指称歧义问题,提出了更精确的局部视觉-语言对齐方案。论文MMCS多模态预训练推荐理由:这篇论文提出MMCS,用50K样本就干翻别人600K的效果,做多模态预训练的可以看看这个新思路。原文稍后读已读值得跟进有用关注 MMCS