8月21日
12:28
12:28IT之家博客/媒体
商汤科技开源SenseNova U1.5 Lite,支持3-4k上下文长度,原生4K图像输出,提升视觉任务稳定性,改善视觉生成和图像编辑能力,加强文字与复杂布局处理。8B参数量轻量化模型,超越同量级模型,媲美超大规模商业模型。

推荐理由:商汤新开源的SenseNova U1.5 Lite模型,支持4K图像输出,功能强大,是处理复杂视觉任务的利器,值得一试。
7月29日
11:13
11:13官方账号arXiv cs.AI@Rui Yang, Weihao Xuan, Yi Lin, Zhuhan Bao, Jonathan Chong Kai Liew, Matthew Yu Heng Wong, Nicolás Lescano, Nikita R. Paripati, Emily Ling-Lin Pai, Jiarui Liu, Heli Qi, Heng-Jui Chang, Benny Kai Guo Loo, Huitao Li, Kunyu Yu, Yufan Wang, Chuan Hong, Shijian Lu, Douglas Teodoro, Naoto Yokoya, Ross Koppel, Mona Diab, Hua Xu, David W. Bates, Nan Liu, Yifan Peng
ClinMM-Bench是迄今最大的多轮多模态临床诊断评估基准,包含1089个真实临床案例和3760张医学图像,覆盖8个专科。研究使用两级评估框架,对15个代表性多模态大模型进行诊断准确性和推理质量评测。结果显示,专有模型总体准确率最高,但完全正确诊断的比例仍很低。错误分析识别出信息整合失败、知识映射错误、感知错误、过早闭合和视觉幻觉五种典型失败模式。
推荐理由:临床诊断AI评估有新基准了!1089个真实案例、3760张影像,15个模型测试下来发现,再好的模型完全正确诊断率也不高,而且容易犯信息整合错误和视觉幻觉。
7月16日
09:33
09:33官方账号arXiv cs.AI@Ting Lei, Jialin Liu, Zhu Xu, Yuxin Peng, Yang Liu
AgentHOI 提出一个无需训练的智能体框架,将多模态大模型的推理能力用于人-物交互检测。它通过上下文感知多轮推理和多方面交互定位两个机制,实现开放场景下的语义推理与空间定位。在真实世界设置中,AgentHOI 超越现有有监督和弱监督方法,且无需任何 HOI 检测训练数据。
推荐理由:这篇论文搞了个 AgentHOI,不用训练数据就能做开放世界的人-物交互检测,靠多模态大模型推理,效果还比有监督方法好。
6月26日
6月16日
11:44
6月9日
11:48
11:48官方账号arXiv cs.AI@Hongcheng Gao, Hailong Qu, Jingyi Tang, Jiahao Wang, Zihao Huang, Hengkang Qiao, Shihong Huang, Junming Yang, Yi Li, Hongyixuan Yuan, Wenjie Li, Bohan Zeng, Wenbo Li, Bo Wang, Jianhui Liu, Olive Huang, Haoyang Huang, Wentao Zhang, Guoqing Huang, Nan Duan, Yinpeng Dong
精选
多模态大模型在物理世界中的空间推理能力至关重要,但现有基准多依赖静态问答或特定模拟器,无法评估真实交互场景。研究者提出SpatialWorld,一个统一基准,整合8种异构仿真后端,包含760个人工标注任务,覆盖家务、旅行、社交协作等领域。智能体需在仅视觉部分可观测条件下主动收集证据,并通过统一文本接口做出决策。评估15个先进智能体发现,最强模型GPT-5平均任务成功率仅17.4%,开源模型Qwen-3.5为14.1%,表明主动探索和长程规划仍是瓶颈。
事件专题

推荐理由:做多模态智能体或空间推理研究的团队,这个基准直接暴露了当前模型在真实交互任务上的短板——GPT-5都只有17.4%成功率,值得用来检验自家模型。
6月2日
11:58
11:58官方账号arXiv cs.AI@Haowen Hou, Zhen Huang, Zheming Liang, Qingyi Si, Chenglin Li, Shuai Dong, Kele Shao, Ruilin Li, Dianyi Wang, Nan Duan, Jiaqi Wang
精选
视频相邻帧通常高度冗余,但现有视频多模态大模型仍将每帧独立编码为RGB图像,导致大量重复视觉token。AdaCodec提出一种预测式视觉编码接口:仅当场景无法从先前上下文预测时才发送完整参考帧,否则仅传输帧间变化(包括运动和预测残差)作为紧凑的P-token。在11个基准测试中,AdaCodec在相同token预算下优于Qwen3-VL-8B逐帧RGB基线;在长视频基准上,仅用1/7预算(32k token)即超越224k基线,并在通用视频基准上提升平均分数,同时将首token延迟从9.26秒降至1.62秒。
推荐理由:做视频理解或多模态模型优化的团队,终于有了一个能大幅降低计算开销而不牺牲性能的方案——AdaCodec用预测式编码直击视频冗余痛点,建议做视频MLLM的开发者直接看论文复现。
5月25日
11:17
11:17官方账号arXiv cs.AI@Haoyuan Wang, Xiaohao Liu, Jiajie Su, Jianmao Xiao, Chaochao Chen
精选
多模态大模型需要高效更新知识,但现有方法在语义等价变体上泛化不足。论文提出ASAM框架,包含Latent Adversarial Robustification(LAR)生成对抗变体,以及Rank-Constrained Subspace Learning(RCSL)通过低秩对齐增强编辑鲁棒性。实验表明该方法在保持可靠性和局部性的同时,显著提升了跨视觉和语言变体的泛化能力。这项工作为多模态知识编辑的鲁棒性提供了新思路。
推荐理由:做多模态大模型知识更新的研究者会关注——ASAM解决了编辑后泛化差的痛点,用对抗子空间对齐让模型对语义等价变体也生效,值得在MLLM编辑任务上试试。
5月19日
14:25
14:25官方账号arXiv cs.AI@Qianhao Yuan, Jie Lou, Xing Yu, Hongyu Lin, Le Sun, Xianpei Han, Yaojie Lu
精选
多模态大模型在细粒度视觉理解任务中常因无法聚焦关键证据而失败,而非缺乏局部识别能力。研究者提出Vision-OPD框架,通过区域到全局的自蒸馏方法,让模型从裁剪后的局部图像(教师)中学习,并迁移到全图(学生)策略上。该方法无需外部教师模型、标注数据或推理时工具,仅通过最小化教师与学生间token级分布差异来提升性能。在多个细粒度视觉理解基准上,Vision-OPD模型性能优于或媲美更大规模的开源、闭源及“思考+图像”智能体模型。
推荐理由:多模态模型开发者常头疼的“看不清细节”问题,Vision-OPD用自蒸馏给出了一个轻量解法——不用外部模型或标注,直接让模型学会“自动放大”关键区域。做细粒度视觉理解或MLLM优化的团队值得关注。