vlms·general

VLMs

别名
首次出现
2026-05-22
最近出现
2026-07-24
累计提及
95
§ 01综述

VLMs(视觉语言模型,Vision-Language Models)是一类能够同时处理图像和文本的多模态人工智能模型,近年因在图像描述、视觉问答等任务上的出色表现而备受关注。它们通过结合视觉编码器和语言解码器,在多种跨模态理解任务中展现出强大能力,但也面临空间推理、细粒度分类等挑战。

VLMs近期进展

  • 改进图像分类的置信度校准:一项研究提出Localized Conformal Prediction方法,通过局部化校准区域提升了VLM在开放集图像分类中的可靠性,有效减少了预测过度自信的问题。原文链接
  • 多脚本OCR能力评估:针对印度天城体文字,研究者构建了压力测试基准并开发后校正方法,发现现有OCR-VLMs在该语言上表现欠佳,验证了跨语言泛化的瓶颈。原文链接
  • 工业流程图转换无需训练:EdgeFlow系统利用边缘图增强VLM,实现了从工业流程图到Mermaid代码的零训练转换,展示了领域自适应能力。原文链接
  • 空间数值理解的重审视:SPACENUM基准测试揭示了VLMs在理解空间位置、距离和数值关系上的系统性缺陷,为模型改进提供了方向。原文链接
  • 当前焦点与观察点

    VLMs的研究焦点正从基础能力评估转向鲁棒性和领域泛化。一方面,置信度校准和零样本迁移等技术进展提升了VLM的实际部署潜力;另一方面,空间推理和多语言OCR等薄弱环节的暴露表明,现有模型在结构化、符号化理解上仍有显著短板。此外,工业应用中的无需微调适配方案表明,VLMs可通过外部知识增强弥补训练数据不足,但模型的可解释性和可靠性仍是待攻克的核心议题。

    § 02相关报道08 条在档
    1. 01
      VLM-IE3D:隐式与显式几何融合的3D感知视觉语言模型
      arXiv cs.LG
    2. 02
      TCLA:无需训练的类别级逻辑适配方法用于医学视觉-语言模型
      arXiv cs.AI
    3. 03
      VLMs计数失败:内部有正确计数但输出不对齐
      arXiv cs.LG
    4. 04
      Analysis-by-Proxy:VLMs作为条件编码器中的定位信号
      arXiv cs.AI
    5. 05
      Localized Conformal Prediction用于VLM图像分类的改进方法
      arXiv cs.LG
    6. 06
      OCR-VLMs 在天城体上的表现:压力测试基准与后校正研究
      arXiv: DeepSeek
    7. 07
      EdgeFlow:边缘图增强VLM实现工业流程图转Mermaid,无需训练
      arXiv cs.AI
    8. 08
      SPACENUM:重新审视VLMs的空间数值理解能力
      arXiv cs.AI
    § 03邻近话题

    本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

    /topic/VLMs