微调 VLM 的朋友看这个:不同能力峰值时间不同,挑 checkpoint 的标准可能让你丢掉可迁移能力,SSR 方法能改善 name-free 检索。
#CLIP
共 18 条 · 7 天 1 条 · 30 天 4 条
信息流里打上「CLIP」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月7日
研究微调过程中视觉语言模型语义能力的获取与退化轨迹
9月29日
VLM-Safe-RL:用 CLIP 信号改进安全强化学习,事故率从 31.6% 降至 19.4%
把 CLIP 接进 PPO-Lagrangian 做安全强化学习,MetaDrive Hard 上事故率降了 12 个点,但作者自己发现信号并不能预判碰撞,分析很实在。
9月28日
9月16日
9月9日
9月1日
8月17日
8月3日
7月30日
7月13日
7月9日
InfraQR:红外视觉语言模型的QR启发式结构化补丁攻击
这篇研究告诉你,红外视觉语言模型有多脆弱——一个 QR 风格的边角补丁就能让 OpenAI CLIP 准确率从 98.67% 跌到 0.70%,还能黑盒攻击其它模型。搞安全或对抗训练的值得一看。
6月23日
6月16日
论文11:09
CrossMaps:置信度感知的开放词汇语义地图用于漫游车导航这篇论文搞了个CrossMaps,让漫游车能用自然语言查地图,比VLMaps多了置信度融合和双记忆,在Jetson Orin上实时跑
6月8日
6月1日
5月28日
5月12日
论文19:10
LLVM在MSTAR SAR图像自动目标识别中达98%准确率该研究首次将LLVM迁移至SAR图像分析,并基于MSTAR数据集建立带标注的ATR基准,为多模态模型在遥感军事应用中的落地提供了可复现的方法论与评估框架。