11:00官方账号arXiv cs.AI@Chunyang Jiang, Pingping Zhang, Yuzhi Zhao, Wenao Ma, Zhijian Hou, Mengyang Wu, Yiyang Cai, Senkang Hu, Sitong Cheng, Chi-Min Chan, Wei Xue, Yike GuoFISA 框架从模型自身的失败案例中生成增强图像,避免使用与模型短板脱节的通用变换。该方法通过自检验和双重保真过滤,在保持答案正确的同时提升图像复杂度。在视觉问答基准上的实验表明,FISA 能持续改进分布内与分布外性能,并与现有文本自增强方法兼容。其合成样本的数据效率也优于通用图像增强基线。论文FISA多模态大语言模型图像增强推荐理由:这篇讲FISA,拿模型答错的题来造新训练图,比瞎做增强更准,还能和文本增强一起用。原文稍后读已读值得跟进有用关注 FISA
11:50官方账号arXiv cs.AI@Wael AbdAlmageedSoftReason是一种全可微分的神经-软-符号推理架构,通过软解释张量弥合感知与演绎的梯度鸿沟。该架构在KVQA(知识感知视觉问答)任务中实例化,支持端到端的感知基础、KG证据注入和可微演绎闭包。核心创新是学习可微的即时后果算子,利用谓词定义嵌入和潜在组合通道实现软体谓词混合。实验表明SoftReason在推理准确率上相比传统神经符号方法提升12%以上。论文SoftReasonKVQA可微推理推荐理由:这篇论文解决了神经符号推理中不可微的离散接口问题,SoftReason让感知和演绎合为一体,KVQA上效果提升明显,搞推理和视觉问答的值得看。原文稍后读已读值得跟进有用关注 SoftReason
12:14官方账号arXiv cs.AI@Siddharth Damodharan, Radhika Gupta, Ali Alshami, Ryan Rabinowitz, Jugal KalitaAUTOPILOT-VQA 是一个针对行车记录仪视频的视觉问答基准,用于评估视觉语言模型在安全关键事故中的推理能力。该基准覆盖天气光照、交通环境、道路布局、路面状态、标志、涉及实体、事故是否发生、撞击位置和事故可避免性等9个类别。数据集基于真实驾驶事故与近事故场景设计结构化问题,要求模型回答场景属性与事件细节。该基准作为 CVPR 2026 竞赛的一部分发布,旨在推动更可解释、鲁棒和安全敏感的视觉语言系统。论文AUTOPILOT-VQAVision-Language ModelsCVPR 2026推荐理由:CVPR 2026 竞赛推出了 AUTOPILOT-VQA 基准,专门测试 AI 模型对行车记录仪事故视频的推理能力,比普通视觉问答更难更贴近安全。原文稍后读已读值得跟进有用关注 AUTOPILOT-VQA
11:13官方账号arXiv cs.AI@Beichen Zhang, Yuhong Liu, Jinsong Li, Yuhang Zang, Jiaqi Wang, Dahua Lin精选多模态大语言模型在视觉推理上虽有进步,但纯文本思维链在处理需要精细关注或视角变换的问题时仍是瓶颈。现有“用图像思考”的方法要么受限于固定工具集,要么产生噪声中间图像。ETCHR 提出第三种方案:使用专用图像编辑模型,并将其与理解模型解耦。它通过两阶段训练(推理模仿和推理增强)解决语言侧和生成侧的差距,使编辑器能根据问题主动进行视觉变换。实验表明,ETCHR 在五个任务族上平均提升 Pass@1 约 5 个百分点,且可即插即用于多种开源和闭源多模态模型。论文多模态推理图像编辑视觉问答推荐理由:做多模态推理或视觉问答的开发者,ETCHR 提供了一种无需微调即可提升模型准确率的思路,值得在现有工作流中试试。原文稍后读已读值得跟进有用关注 多模态推理
11:05官方账号arXiv cs.AI@Basel Shbita, Pengyuan Li, Anna Lisa Gentile精选WikiVQABench 是一个人工策划的知识驱动视觉问答(VQA)基准,通过系统结合 Wikipedia 图像、文章标题和 Wikidata 结构化知识构建。它使用大语言模型生成候选多项选择题,再由人工审核确保事实正确性和视觉-文本一致性,要求每个问题必须依赖外部知识才能正确回答。评估了 15 个视觉语言模型(256M-90B 参数),准确率范围从 24.7% 到 75.6%,表明该基准能有效区分模型在知识密集型推理上的能力。数据集和代码已公开。论文视觉问答知识驱动基准测试推荐理由:做 VQA 或视觉语言模型评测的团队终于有了一个真正需要外部知识的基准,不再是纯视觉感知题——想测试模型知识推理能力的可以直接用这个数据集。原文稍后读已读值得跟进有用关注 视觉问答
19:10官方一手arXiv: OpenAI@Wenxuan Li, Pedro R. A. S. Bassi, Xinze Zhou, Jakob Wasserthal, Alan L. Yuille, Zongwei ZhouRadThinking是一个用于放射学纵向临床推理的视觉问答数据集,覆盖20362次CT扫描、9131名患者和2077名健康对照。数据集按推理深度分为三级:基础感知问题、单步规则推理问题和需要多步链式思维推理的组合问题。每个组合问题都附带基于临床报告标准的链式思维路径。该数据集首次将癌症筛查临床推理分层标注,支持训练和评估AI系统的推理能力而不仅仅是检测能力。论文医学影像推理模型视觉问答推荐理由:该数据集为训练AI进行符合临床指南的多步推理提供了标准化基准,对医学影像AI从感知向认知升级有重要价值。原文稍后读已读值得跟进有用关注 医学影像