#视觉语言模型
这篇研究告诉你,红外视觉语言模型有多脆弱——一个 QR 风格的边角补丁就能让 OpenAI CLIP 准确率从 98.67% 跌到 0.70%,还能黑盒攻击其它模型。搞安全或对抗训练的值得一看。
VAORA 用一个巧妙的奖励设计,让 VLM 在物理推理中不再瞎想,在 PHYRE 和 Virtual Tool 上泛化能力更好。
想测测视觉语言模型能不能只看截图就生成可交互的网页应用?这篇论文提出了UI2App基准,发现模型在视觉还原上还行,但交互推理差得远,最高分才7.5。
这论文搞了个超轻量的图像模糊检测模块,7毫秒就能判断,能帮下游视觉语言模型省掉很多无用计算。实测F1到0.98,模型才17MB,值得做生产管线的看看。
自动驾驶新框架Lagrange用掩码潜在场和VLM处理开放世界异常,比密集模型更高效,在nuScenes和CODA上表现不错。
FusionRS填补了RGB-红外双模态遥感数据集的空白,用公开RGB图转红外风格,加上两种描述,让模型同时理解可见光和红外信息。
想知道AI能不能像人一样在危险场景下抓住关键区域?这篇论文用GPT-4o、Gemini Pro等模型做了对比,发现它们不靠眼动训练数据就能大致预测人类注视点。
做视觉语言模型部署或实时推理的开发者,Zamba2-VL 的首 token 延迟优势能显著提升用户体验,值得直接尝试。
VLM推理成本高是实际部署的痛点,Reroute用零训练代价解决了令牌缩减中信息丢失的问题,做多模态模型优化或部署的团队可以直接集成到现有方案中,值得一试。
FADA 解决了中低收入国家超声技师短缺导致的产前筛查缺口,做医疗 AI 或边缘部署的团队可以直接在手机上跑完整流程,值得关注其开源代码和模型。
长视频理解一直受限于 token 爆炸和注意力稀释,MemDreamer 用智能体检索和分层记忆解决了这个痛点。做视频分析、多模态研究的团队可以直接参考其框架,在现有模型上即插即用,值得一试。
放射科医生和医学影像 AI 研究者终于有了一个能真正做前后对比和参考病例检索的框架——MedReCo 在 12 项检索任务中全胜,做临床 AI 落地的团队值得关注。
多数实验室事后才考虑推理效率,而 Step 3.7 Flash 从设计之初就为推理优化,做智能体应用和视觉语言模型的开发者可以直接试用,感受 400 tok/sec 的流畅体验。
空间推理是多模态模型的短板,IPT 提供了一种不依赖文本思维链的监督方式,做视觉推理或空间理解的团队可以直接参考论文方法。
做具身智能或3D视觉问答的团队,终于有了一个不用暴力融合所有模态的轻量方案——MASER根据问题语义动态选最优模态,点云在超半数场景下最准,值得在Open3D-VQA上试试。
做工业视觉检测的团队会发现,当前号称支持文本引导的模型其实并不听指令——TGAD基准直接戳破了这个泡沫,建议点开看看你的模型是否真的被语言控制。
做AI公平性研究或模型对齐的团队,这篇论文直接戳破了VLM在模糊输入下的性别偏见黑箱——LALS方法让你能逐层看到模型内部编码与输出的脱耦,建议做模型审计的开发者点开看看具体实验设计。
做 AI 编程智能体或搜索应用的团队可以直接用上 256k 上下文和视觉能力,Step 3.7 Flash 的 Advisor Mode 能显著提升复杂任务处理效率,值得关注。
时序异常检测终于有了可解释的小模型方案,做工业监控或运维分析的团队可以直接用VisAnomReasoner替代大模型,精度更高、成本更低,建议点开看具体微调方法。
轻量级VLM在复杂场景中经常胡编乱造,DRScaffold用结构化监督解决了这个痛点,做视觉推理或部署小模型的团队可以直接用它的框架和基准来提升可靠性。
做 OOD 检测或 VLM 应用的开发者,这篇解决了负样本挖掘的假负问题,理论扎实且效果显著,值得直接参考代码复现。
微信AI团队解决了视障辅助场景中VLM“说太多”和“说太频繁”的痛点,做AI助残或边缘端VLM的开发者可以关注其减少冗余的思路,实时性已接近可用,值得点开了解技术细节。
古文字识别是AI视觉的硬核边界,做OCR或文化遗产数字化的团队可以直接用这个基准测试自家模型,看看它们穿越回3000年前还能不能认出字。