8月3日
7月13日
10:50
10:50官方账号arXiv cs.AI@Shravan Murlidaran, Miguel P. Eckstein
论文引入Complex Social Behavior (CSB)数据集,包含100张复杂社交场景图片。研究评估了2017-2025年间4个pre-MLLM和5个MLLM模型在CSB和MS-COCO上的表现,并与20个人类描述对比。分析了物体检测、识别、幻觉、场景理解和空间依赖五种错误类型。MLLM在CSB上的场景描述准确率与人类顶级描述相当,几乎消除了所有错误类型,但偶尔仍存在空间依赖误差。
推荐理由:这篇论文用新数据集CSB系统地测了十年间视觉语言模型的进化,发现最新模型在复杂社交场景上已经跟人类顶级描述差不多准了,只有空间依赖错误还没完全解决。
6月23日
11:04
11:04官方账号arXiv cs.AI@Zhuoran Jin, Kejian Zhu, Hongbang Yuan, Yupu Hao, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao
该研究系统评估12项多模态任务,涵盖感知与推理两类,使用14个非推理模型和8个推理模型。结果显示,CoT在视觉定位、目标计数等感知任务中会导致性能下降,但在数学、科学和多图推理中有效。开源多模态推理模型整体提升有限,可能因过度侧重数学。当前多模态CoT存在'轻看,重思'模式,视觉反省持续减弱,而口头反思相对保持。视觉推理仍是主要瓶颈。
推荐理由:这篇论文系统测了多模态思维链到底行不行,发现它在视觉定位上帮倒忙,但对数学推理很管用,还揭示了视觉瓶颈。做多模态的值得看。
6月12日
09:46
09:46官方一手arXiv: DeepSeek@Xu-Jing Ye, Yuan-Gen Wang, Ruping Wang
L-VARC是一种新框架,通过语言引导的LUPI分支增强视觉推理,解决ARC任务中纯语言模型参数大、纯视觉模型过拟合的问题。它利用DeepSeek-V3压缩语义,用CLIP对齐视觉与语义特征,训练后丢弃语言分支,仅保留18M参数的轻量模型。实验表明,L-VARC在ARC任务上超越现有最佳方法,代码已开源。
推荐理由:ARC是AGI的关键测试,L-VARC用语言引导视觉推理,18M参数就能超越SOTA,做视觉推理或小模型研究的开发者值得一试。
6月3日
10:17
10:17官方账号arXiv cs.AI@Senjie Jin, Peixin Wang, Boyang Liu, Xiaoran Fan, Shuo Li, Zhiheng Xi, Jiazheng Zhang, Yuhao Zhou, Tao Gui, Qi Zhang, Xuanjing Huang
精选
研究发现,在视觉推理任务中,仅依赖令牌级熵进行强化学习(RLVR)会失效,因为视觉敏感但熵低的令牌被忽略。现有多模态RL方法要么缺乏系统视觉度量,要么忽视熵主要驱动语义探索。为此,研究者提出VEPO框架,通过视觉敏感性与令牌熵的乘法耦合,将梯度信用分配给同时具备视觉基础和高信息量的令牌。实验表明,VEPO在7B和3B规模上分别比熵基线提升2.28和3.15个百分点,消融实验验证了方法的有效性。
推荐理由:视觉推理强化学习一直缺乏有效的信用分配机制,VEPO解决了这个痛点——做多模态RL的团队可以直接参考这个框架,在视觉-语义交叉场景中提升模型表现。
6月1日
15:05
15:05官方账号NVIDIA AI@NVIDIAAI
93°
NVIDIA 宣布推出 Cosmos 3,号称全球首个完全开放的全能模型,原生支持视觉推理、世界生成和动作生成。该模型提供 Super(32B)和 Nano(8B)两个版本,面向物理 AI 领域的研究与开发。Cosmos 3 的开源特性有望加速机器人、自动驾驶等物理世界交互系统的训练与部署,降低开发者门槛。
事件专题

推荐理由:做机器人或自动驾驶的团队终于有了一个全开源的物理世界模型——Cosmos 3 原生支持视觉推理和动作生成,32B 和 8B 两个版本覆盖不同算力场景,值得直接上手试试。