多模态大模型·general

多模态大模型

别名
首次出现
2026-05-22
最近出现
2026-07-29
累计提及
21
§ 01综述
  • 多模态大模型是人工智能领域的一个热点,它结合了多种类型的数据输入(如文本、图像、声音等),以提高模型的感知和理解能力。
  • 近期,多模态大模型的研究和应用取得了显著进展,包括在临床诊断、人-物交互、自动驾驶等多个领域的应用。
  • XX 近期进展

  • 多轮多模态临床诊断推理基准ClinMM-Bench发布:该基准旨在提升多模态临床诊断推理的能力,发布于2026年7月。
  • Symbal: 检测模型生成图像描述中的系统性偏差:Symbal模型可以检测模型在生成图像描述时的系统性偏差,有助于提升多模态模型的可解释性。
  • AgentHOI:无需训练的多模态大模型用于开放世界人-物交互检测:AgentHOI模型能够检测开放世界人-物交互,无需额外的训练过程。
  • 2026世界人工智能大会将首发超300款AI产品,上海世博馆布展中:大会将展示多模态大模型等AI产品的最新进展。
  • 多模态大模型视觉-语言感知范式演变综述:综述了多模态大模型视觉-语言感知范式的演变过程。
  • 当前焦点与观察点

  • 多模态大模型在自动驾驶、临床诊断等领域的应用成为焦点,但同时也面临数据隐私、偏见等问题。
  • 如何提高模型的可解释性和可靠性是当前的研究热点。
  • 大规模多模态数据的获取和处理也成为研究的难点。
  • § 02相关报道10 条在档
    1. 01
      多轮多模态临床诊断推理基准ClinMM-Bench发布
      arXiv cs.AI
    2. 02
      Symbal: 检测模型生成图像描述中的系统性偏差
      arXiv cs.AI
    3. 03
      AgentHOI:无需训练的多模态大模型用于开放世界人-物交互检测
      arXiv cs.AI
    4. 04
      2026世界人工智能大会将首发超300款AI产品,上海世博馆布展中
      IT之家
    5. 05
      多模态大模型视觉-语言感知范式演变综述
      arXiv: OpenAI
    6. 06
      UniDrive:面向自动驾驶可解释风险理解的统一视觉语言与定位框架
      arXiv cs.AI
    7. 07
      检索增强可靠性感知框架减少多模态系统视觉幻觉
      arXiv cs.AI
    8. 08
      SpatialWorld:多模态智能体交互式空间推理新基准
      arXiv cs.AI
    9. 09
      高通发布车端AI Claw生态计划,将智能体引入智能座舱
      IT之家
    10. 10
      多模态大模型评测偏见:Perceptual Perturbation 与 Reward Modeling 缓解方案
      arXiv cs.AI
    § 03邻近话题

    本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

    /topic/%E5%A4%9A%E6%A8%A1%E6%80%81%E5%A4%A7%E6%A8%A1%E5%9E%8B