11:32官方账号arXiv cs.AI@Yijun Liang, Yunjie Tian, Yijiang Li, Yuqi Jia, Furong Huang, Tianyi Zhou, Di FuVCSD提出一种新的自蒸馏方法,通过对比原始图像和内容擦除控制的token级log概率差异来生成蒸馏信号。在ViRL39K数据集上,基于Qwen3-VL的实验显示,2B模型七基准聚合从62.27%提升至67.04%,4B从71.30%提升至73.16%,8B从72.51%提升至76.26%。VCSD无需外部教师、特权答案或视觉证据信号,且不增加推理开销。论文VCSDQwen3-VLQwen3.5推荐理由:这篇论文提出了VCSD,不需要外部老师就能让多模态模型自己教自己,在Qwen3-VL上几个规模都涨了4-5个点,而且不增加推理成本。原文稍后读已读值得跟进有用关注 VCSD