VLM引导的弱监督密集视频字幕生成
官方账号arXiv cs.AI@Ye-Chan Kim, Seunghee Choi, SeungJu Cha, Si-Woo Kim, Hwiseon Kim, Hyungee Kim, Dong-Jin Kim原文
VLM先看后合成,让视频字幕生成更精准,比传统方法更智能地找到事件变化点。
VLM先看后合成,让视频字幕生成更精准,比传统方法更智能地找到事件变化点。
这篇论文戳破了弱监督场景下性能指标的泡沫,做元数据分类或标签质量审计的团队会发现,你报告的准确率可能只是标签流程的镜像,值得点开重新审视评估方法。