#多模态大模型
临床诊断AI评估有新基准了!1089个真实案例、3760张影像,15个模型测试下来发现,再好的模型完全正确诊断率也不高,而且容易犯信息整合错误和视觉幻觉。
这篇论文搞了个 AgentHOI,不用训练数据就能做开放世界的人-物交互检测,靠多模态大模型推理,效果还比有监督方法好。
这个框架把时序推理和高分辨率感知结合起来,在DRAMA-Reasoning上碾压了现有方法,还能零样本泛化到NuScenes和BDD100K,代码也开源了,做自动驾驶可解释性研究的值得一看。
做多模态智能体或空间推理研究的团队,这个基准直接暴露了当前模型在真实交互任务上的短板——GPT-5都只有17.4%成功率,值得用来检验自家模型。
高通把智能体AI直接塞进车端,解决了座舱开发碎片化痛点,做车载系统或智能座舱的团队值得关注,这可能是量产落地的加速器。
做视频理解或多模态模型优化的团队,终于有了一个能大幅降低计算开销而不牺牲性能的方案——AdaCodec用预测式编码直击视频冗余痛点,建议做视频MLLM的开发者直接看论文复现。
做多模态模型评测的团队终于有了对抗感知偏见的方法——Perceptual Perturbation 框架能直接提升评估者的视觉可靠性,建议做 MLLM 评测基准的开发者点开看看实验细节。
高分辨率图像感知是 MLLMs 落地的硬骨头,CVSearch 用零训练成本解决了覆盖率和效率的矛盾,做多模态感知或视觉问答的团队可以直接拿来用。
多模态模型开发者常头疼的“看不清细节”问题,Vision-OPD用自蒸馏给出了一个轻量解法——不用外部模型或标注,直接让模型学会“自动放大”关键区域。做细粒度视觉理解或MLLM优化的团队值得关注。
脑电信号理解一直受限于文本对齐的信息损失,GVG用生成图像作为桥梁,让MLLM能利用视觉先验进行更丰富的解读。做脑机接口或神经科学AI的团队,这个框架值得关注,轻量模型就能达到大模型效果。
催化材料研究者终于有了一个能同时做性质预测和逆向设计的统一模型,避免了传统解耦方法的数据偏移问题,做材料计算和 AI 辅助设计的团队可以直接参考其方法。
做多模态情感分析或评估 MLLMs 情感能力的团队,终于有了一个更可靠的多标签基准——MultiEmo-Bench 解决了现有数据集低估模型的问题,值得直接用于模型评测。