11:10官方账号arXiv cs.AI@Elaine Lau, Thanuka Udumulla, Lee Izhaki-Tavor, Francisco Guzmán, Nicholas Magazine, Jonas MuellerVIALS基准包含161个视觉解释任务,涵盖生物技术行业中实验工作流程中检查的各类视觉艺术品。尽管前沿视觉语言模型能够流畅描述自然图像,但它们无法准确解释这些科学图像,反映出在领域知识和特定领域视觉推理能力方面的局限性。相比之下,具有相关领域专业知识的科学家发现这些视觉解释任务很简单。无法类似解释这些图像的AI在专业生命科学工作流程中将具有有限的应用价值,因为这些艺术品是科学家推理、沟通和做决策的核心。论文VIALS视觉解释生命科学推荐理由:VIALS基准为视觉语言模型在生命科学领域的应用提供了新的评估标准,有助于识别模型在特定领域的局限性。原文稍后读已读值得跟进有用关注 VIALS
09:52官方一手arXiv: DeepSeek@Bipasha Kundu, Abhishek Chaturvedi, Axel W. E. Wismueller, Richard Simon, Cristian A. LinteLGE心脏MRI在心房颤动患者中用于左心房纤维化评估和消融规划,图像质量对消融过程至关重要。本研究提出一种两阶段视觉语言模型(VLM)框架,用于左心房LGE-MRI的临床图像质量评估。第一阶段,微调的VLM生成结构化的放射学风格质量报告,预测五个放射科医生定义的标准:噪声、运动伪影、左心房边界准确性、肺静脉区域准确性和过度分割严重程度。第二阶段,基于GPT的推理模块将预测的质量和报告映射到结构化的质量评分和二进制临床可用性决策。使用60个标注的图像切片-文本对进行基准测试,InternVL2在标准级别上达到最高准确率(平均ACC=0.65,PLCC=0.79),DeepSeek在临床可用性上达到完美的一致性(准确率=1.00,kappa=1.00)。论文视觉语言模型图像质量评估心脏消融规划推荐理由:这篇论文提出了一种基于视觉语言模型的心脏消融规划LGE-MR图像质量评估方法,通过两个阶段的模型预测图像质量,有助于提高消融过程的安全性。与现有方法相比,InternVL2和DeepSeek在准确性和临床可用性方面表现出色。原文稍后读已读值得跟进有用关注 视觉语言模型
15:33官方账号arXiv cs.AI@Yuanzhi Xu, Qian Gao, Jun Fan, Guohui Ding, Zhenyu Yang, Yuteng Xiao, Sixue Lin本研究提出密集同类属性错绑(DSCAM)问题,指视觉语言模型在拥挤场景中将属性错误分配给同类实例。作者发布InstaBind-Lite基准,含524张图像、529组3-6个同类实体、1773个框选实例及9580个确定性评估问题。测试5个开源和2个商业/API模型,开源系统平均错绑率19.84%,API系统7.55%,且80%以上错误源于相邻实例。该基准将错误答案分类为可识别来源,检验模型是否知道每个属性归属哪个实例。论文InstaBind-Lite视觉语言模型DSCAM推荐理由:想测多模态模型在拥挤场景里会不会张冠李戴?这个新基准InstaBind-Lite能精准量化,开源模型错绑率近20%,比想象中严重。原文稍后读已读值得跟进有用关注 InstaBind-Lite
00:05官方一手marktechpost@Asif RazzaqLiquid AI发布LFM2.5-VL-3B,一个3.1B参数的视觉语言模型,专为端侧部署设计。该模型在ScreenSpot-v2上平均得分80.7,在RefCOCO指代分割任务上从57.1提升至87.9。函数调用能力首次加入VL系列,ToolSandbox得分从26.4跃升至59.5。模型体积约3GB,在Apple M5 Max上解码速度达228 tokens/s。AI模型LFM2.5-VL-3BLiquid AI视觉语言模型推荐理由:Liquid AI把视觉语言模型塞进端侧,能读屏、指物、调工具,3GB体积在苹果芯片上跑得飞快。原文稍后读已读值得跟进有用关注 LFM2.5-VL-3B
18:08官方账号Cohere@cohere精选Cohere 今日推出 North Micro Vision,这是其最小的视觉语言模型,专为复杂文档理解设计。该模型以 Apache 2.0 许可证开源,权重已上传至 Hugging Face。相比 Cohere 其他模型,North Micro Vision 更轻量,适合在资源受限场景下处理视觉任务。开发者可直接从 Hugging Face 下载权重进行部署。AI模型CohereNorth Micro Vision视觉语言模型推荐理由:Cohere 出了个超小的视觉模型 North Micro Vision,专门用来读懂复杂文档,而且开源了,直接去 Hugging Face 就能下载权重。原文稍后读已读值得跟进有用关注 Cohere
11:36官方账号arXiv cs.AI@Haoyu Yang, Meixing Shi, Zengjie Chen, Haoran Sun, Haitao Leng, Xiaoming Shi, Yuxiang Cai, Yankai JiangMedPixel是一个统一的医学像素-语言模型,通过共享的语言-掩码接口连接临床语言、视觉推理与像素级定位。研究团队构建了MedPLG-440K数据集,包含约44万个像素-语言任务样本,通过临床驱动的合成流程生成,无需外部LLM标注。模型采用联合多任务监督微调和像素级偏好优化训练,后者利用真实掩码作为离线验证器,从掩码质量推导响应偏好。MedPixel支持显式定位、隐式推理、空间交互、可解释分割和医学VQA等任务,在像素级预测和响应生成上均表现强劲,并具备对零样本外部基准和模糊空间提示的鲁棒性。论文MedPixel医学图像分割视觉语言模型推荐理由:医学图像分割和语言模型终于打通了,MedPixel一个模型搞定定位加问答,还自带44万样本的数据集,搞医学AI的值得看看。原文稍后读已读值得跟进有用关注 MedPixel
11:08官方账号arXiv cs.AI@Bhavika Jalli, Nikhil Korati Prasanna, Jayanta Choudhury论文提出用视觉语言模型处理数值时间序列,将KPI窗口编码为2D图,在Llama-3.2-90B、Qwen2.5-VL-72B和Pixtral-12B上实现3.6-10.4倍输入token缩减。实测推理能耗降低1.8-2.5倍,在电信边缘部署中每天节省约7.2MJ。微调的Llama-3.2-90B-Vision异常检测精度比文本版高220.7%,比LSTM和ARIMA高144%。Pixtral-12B在公共基准上J/F1提升20.6倍,平均F1为0.82。论文Llama-3.2-90BQwen2.5-VL-72BPixtral-12B推荐理由:这篇论文告诉你,把数据画成图再给模型看,能省电还更准。电信场景实测能耗降2.5倍,精度翻倍,值得做时序分析的人看看。原文稍后读已读值得跟进有用关注 Llama-3.2-90B
09:21官方账号arXiv cs.AI@J. de Curtò, Dayani Plasencia, Diego Sánchez, I. de Zarzà这项研究通过输入消融测试,检查视觉语言模型(VLM)在零样本控制中是否真正依赖视觉输入。在9个直接控制模型、6个结构化局部VLM和1个VLM-MPC层级中,分析了32,874次评分调用。结果显示多数直接控制模型表现负面,常数SLOW策略甚至优于脚本几何控制器。图像仅确定性正对照以0.090米MAE和精确镜像等变性估算前车间距,证明视觉刺激信息充分。后验对称一致性守护者选出的模型在272帧上达到0.954平衡准确率,弃权时提升至0.973。论文VLM视觉语言模型具身智能推荐理由:这篇论文用消融实验戳穿了VLM做零样本控制的假象,多数模型其实没在看图像。还给出了一个能到0.973准确率的守护方案,想搞具身智能的值得看。原文稍后读已读值得跟进有用关注 VLM
11:41官方账号arXiv cs.AI@Mercy Prasanna Ranjit, Anirban Porya, Sathvik Joel, Niharika Vadlamudi, Nikhilesh Chowdary Eathamukkala, Prasanth V, Abhyuday Kumara Swamy, Pranay Narhari Umredkar, Pradeep Narayan, Vivek Rajagopal, Tanuja GanuCARE-X 在生成骨干网络上增加焦损失分类与复合损失定位头,与语言建模目标联合训练,使胸片报告生成、发现分类和空间定位互相增强。配合任务级奖励优化的 DAPO 策略,该方法在四个报告生成基准的大部分指标上达到最优,ReXVQA 视觉问答准确率 94.0%,比次优基线高 6.0 个百分点。此外,将 Qwen3-VL-4B-Instruct 与可调用确定性测量工具的原生工具能力结合,在五个依赖测量的诊断场景中平均 F1 比仅靠感知的基线高 43.6 个百分点。论文CARE-XQwen3-VL胸片推荐理由:医学影像领域的小伙伴可以看看这篇,CARE-X 把胸片分类、定位、报告生成整合到一个模型里,还靠工具调用做解剖测量,临床实用性比纯生成模型强不少。原文稍后读已读值得跟进有用关注 CARE-X
11:23官方账号arXiv cs.LG@Maximilian Dillitzer, Tin Stribor Sohn, Jason J. Corso, Michael Auerbach该研究在13个模型(9个LLM和4个VLM)中系统评测了字母大小写对注意力分配的影响。实验发现,将目标信息改为交替大小写或大写,能显著集中文本注意力。但这种注意力集中并不提升下游准确率,在交替大小写的高熵场景下甚至会造成下降。推理模型的思考阶段会缓冲这类排版敏感性,而视觉语言模型则表现出部分迁移效应。研究将大小写视为无需模型访问或微调的零样本注意力引导机制。论文大小写注意力机制LLM推荐理由:这篇arXiv研究测了13个模型:把关键词大写能集中LLM注意力,但准确率不一定提高,交替大小写还会拖累成绩。原文稍后读已读值得跟进有用关注 大小写
09:30官方账号arXiv cs.AI@Timothee Mickus, Claudio Savelli, Eduardo Calò, Emilio Raimond, Stella Frank, Hengyu Luo, Flavio Giobergia, Vincent Segonne, Chuyuan Li, Aman Sinha, Lorenzo Vaiani, Jörg Tiedemann, Raúl Vázquez该研究构建了包含1,600个人类编写的幻觉样本数据集,覆盖中、英、法、意四种语言,并同时收集了来自五个视觉语言模型的18,400个样本进行对比。所有样本采用细粒度的跨度级标注方案来标记幻觉。实验发现,人类编写的样本在标注一致性上更高,且便于控制数据集内容,同时与模型生成样本在分布上保持相似。这表明人类数据可以替代模型生成的幻觉基准,用于更稳定的模型幻觉评估。论文幻觉检测基准测试视觉语言模型推荐理由:这篇论文用1,600个人类写的幻觉样本对比了18,400个模型生成的样本,发现人类样本更稳定、更好控制,以后测幻觉不用老换模型了。原文稍后读已读值得跟进有用关注 幻觉检测
11:56官方账号arXiv cs.AI@Yifei Zhao, Xiangxin Zhou, Wenhao Yang, Jiaqi Tang, Pu Jian, Huanjin Yao, Jiarui Yao, Haowei Lin, Chunchao Guo, Zhuo Chen, Wenkai Lyu, Jianzhu Ma, Xueqian Wang, Wenxi ZhuSceneActBench 是一个评估视觉语言模型(VLM)代理在3D场景中行动能力的基准,包含5个任务,覆盖210个源实例和520个任务案例。每个任务在统一的代理-环境循环中运行,使用任务特定的几何指标评估最终输出。在11个专有VLM配置上测试,总体得分范围为38.6到50.2,没有任何配置在所有任务上表现一致。论文分析了失败模式,指出当前模型在多对象3D场景中的行动能力仍有显著不足。论文SceneActBench3D场景视觉语言模型推荐理由:想测测视觉语言模型能不能真在3D空间里干活?SceneActBench给你5个任务、520个案例,开源又公平,看哪个模型分高。原文稍后读已读值得跟进有用关注 SceneActBench
12:27官方账号arXiv cs.AI@Dankai Liao, Tianyi Zhang, Yufeng Wu, Xinyue Zhang, Qiaochu Xue, Zeyu Liu, Dachun Zhao, Linghan Cai, Yueming JinPathAgentBench评估视觉语言模型在整张病理切片上的四种能力:跨模态匹配、区域定位、多尺度推理。基准包含1822张TCGA整张切片和17135条诊断路径。在20个模型中,开源模型在多尺度推理上达到93%准确率,但诊断区域定位的IoU低于0.09。自主探索时高倍放大下命中率仅0.020,表明从WSI获取证据仍具挑战。AI模型PathAgentBenchTCGA病理图像推荐理由:想测试病理AI能不能像医生一样在超大图片里找病灶?这个基准专门考这个,结果发现定位能力还很弱。原文稍后读已读值得跟进有用关注 PathAgentBench
09:52官方账号arXiv cs.AI@Zhenyu Zhao, Nanshan Jia, Jihyeon Je, Yifu Tang, Alvin Chan, Michael Spedden, Michael V. Palleschi, Sui Huang, Jingshen Wang, Zeyu Zheng3D-DefectBench是一个用于系统分析基于视觉语言模型(VLM)的3D缺陷检测管道的基准和框架。它涵盖9种细粒度二分类缺陷(几何、纹理、提示遵循),通过平衡因子设计,在84种推理设计和约320万评分缺陷决策上变化4个管道因子(VLM、相机协议、视觉输入、提示方案)。模型选择是与人标注一致性最大的决定因素,但其他因子也影响性能并与模型选择交互。紧凑的六视图RGB协议与更密集的多视图设置性能相当。最佳VLM法官仍落后于经过训练的人类标注者。论文3D-DefectBenchVLM视觉语言模型推荐理由:想搞3D生成质量自动评估?这篇论文告诉你:光选模型不够,整个评估管道都得调。六视图RGB就够用,省成本。原文稍后读已读值得跟进有用关注 3D-DefectBench
09:16官方账号arXiv cs.AI@Ricardo Maia Avelino, Rita Sevastjanova, Tom Van Mele, Philippe Block, Mennatallah El-Assady该论文指出,当前追求消除摩擦的生成式AI(如通用对话模型)与结构设计师通过迭代摩擦激发创意的需求存在错位。研究者提出一个基于视觉语言模型的协同设计系统,使结构探索变得对话式、多模态,并能响应用户的演化意图。通过一个原型界面和与领域专家的研究,发现该系统能减少重复性建模摩擦,同时保留有益于创意生成的反思维摩擦。论文视觉语言模型结构设计人机交互推荐理由:这篇研究说AI一味追求“省事”反而帮倒忙——结构设计需要“摩擦”来激发灵感。他们用视觉语言模型做了个交互系统,帮设计师边想边改,保留思考摩擦,去掉重复劳动。原文稍后读已读值得跟进有用关注 视觉语言模型
09:11官方账号arXiv cs.AI@Feng He, Zhenting Wang, Qifan Wang, Qiang Guan, Dongfang Liu, Ruixiang Tang, Qiankun LiHIVE是用于研究视觉语言模型幻觉后推理(PHR)的评估基础设施,支持在忠实caption与幻觉caption之间进行受控比较。在9个任务和9个模型上的实验表明,幻觉caption在视觉语言任务上平均提升准确率,而纯文本任务的影响有限且不稳定。进一步分析显示,幻觉线索扩展了语义覆盖范围并重塑推理动态,同时保持稳定的推理路径。该研究揭示了视觉语言模型中幻觉语义进入推理阶段后的具体影响机制。论文HIVEVLM幻觉后推理推荐理由:这篇论文用HIVE框架系统分析了VLM的幻觉后推理,发现幻觉caption反而提升部分视觉任务准确率,值得看看他们怎么设计和验证的。原文稍后读已读值得跟进有用关注 HIVE
09:08官方一手arXiv: OpenAI@Xin Li, Jiaju Han, Ma Yaqi, Chengyin Hu, Yingying Zhao, Jiahuan Long, Fengyu Zhang, Yahui Chai精选InfraQR 是一种针对红外视觉语言模型的攻击方法,将紧凑结构化补丁沿图像边界放置,通过代理 CLIP 编码器优化可学习网格单元。在 300 张红外图像基准上,InfraQR 将 OpenAI CLIP 的分类准确率从 98.67% 降至 0.70%。攻击还迁移到黑盒字幕和 VQA 模型,导致字幕语义退化,并在 GPT-5.4 评估下产生更易错的答案。结果表明红外视觉语言模型易受边缘结构化扰动影响,需进一步研究跨任务鲁棒性。论文InfraQRCLIPOpenAI1 个信源在谈事件专题推荐理由:这篇研究告诉你,红外视觉语言模型有多脆弱——一个 QR 风格的边角补丁就能让 OpenAI CLIP 准确率从 98.67% 跌到 0.70%,还能黑盒攻击其它模型。搞安全或对抗训练的值得一看。原文稍后读已读值得跟进有用关注 InfraQR
12:18官方账号arXiv cs.AI@Han-Jun Ko, Jr-Jen Chen, Haobo Yuan, Hsin-Ying Lee, Tiancheng Shen, Ming-Hsuan Yang, Yu-Chiang Frank WangVAORA (Visual Action Outcome Reasoning Alignment) 提出两种互补奖励:Visual Alignment Reward 将 VLM 推理锚定到视觉上下文,独立于智能体动作;Visual-Action Alignment Reward 将推理与动作引起的视觉结果对齐。该方法在 PHYRE 和 Virtual Tool 基准上,针对未见任务和未见环境设置提升性能,抑制幻觉链式推理并缩小推理与行为差距。实验表明,VAORA 能诱导基于视觉的、可泛化的物理智能。AI模型VAORA视觉语言模型物理推理推荐理由:VAORA 用一个巧妙的奖励设计,让 VLM 在物理推理中不再瞎想,在 PHYRE 和 Virtual Tool 上泛化能力更好。原文稍后读已读值得跟进有用关注 VAORA
12:09官方账号arXiv cs.AI@Cong Su, Jiaju Han, Xuemeng Sun, Chengyin Hu, Qike Zhang, Jiujiang Guo, Yiwei Wei, Jiahuan Long精选研究者提出AirflowAttack,首个针对红外遥感视觉语言模型的对抗攻击方法,利用热气流湍流作为扰动先验。该方法通过轻量生成器合成输入无关的扰动,在五个CLIP骨干上平均零样本场景分类攻击成功率达48.5%,超过四个物理基线(27.7-37.0%)。对六个SOTA视觉语言模型,场景分类准确率相对降低38.2%,但某些模型反而更自信地将扰动误判为真实热证据。消融实验显示气流先验在提升物理合理性时未牺牲攻击成功率。该基准覆盖十一个模型和四项任务,暴露了红外遥感视觉语言模型的脆弱性。论文AirflowAttack红外遥感视觉语言模型推荐理由:这篇论文把热气流变成攻击红外遥感模型的武器,攻击成功率48.5%,还能让模型更自信地犯错,搞AI安全的一定要看。原文稍后读已读值得跟进有用关注 AirflowAttack
09:53官方账号arXiv cs.AI@Grace Man Chen, Litao Guo, Yifan Wu, Yiyu Chen, Yenchi Tseng, Sicheng Liu, Yuyu Luo, Ying-Cong Chen论文提出UI2App基准,专门评估从截图推断交互行为的能力,无需文本或行为指导。基准包含327张截图,分为45个状态一致组,用于多路由网页应用。评估沿四个维度:可执行性、导航可达性、视觉保真度和交互推理,其中交互指标(IIS)按功能正确性和状态管理复杂度评分。在6个前沿视觉语言模型上,视觉保真度领先者仅得7.5的IIS,落后IIS冠军5.2倍;半数模型在高复杂度跨页面状态交互上得零。结果显示从静态截图推断完整交互行为仍是关键挑战。论文UI2App基准测试交互推理推荐理由:想测测视觉语言模型能不能只看截图就生成可交互的网页应用?这篇论文提出了UI2App基准,发现模型在视觉还原上还行,但交互推理差得远,最高分才7.5。原文稍后读已读值得跟进有用关注 UI2App
11:36官方账号arXiv cs.AI@Xuehui Wang, Xuankun Yang, Wei Shen视觉Token剪枝是加速VLM的关键策略,但现有方法在密集指令和细粒度查询下难以保留关键线索。本文提出EADP框架,首先利用统计熵量化并过滤文本噪声,得到细粒度的指令相关性分数;然后通过子模最大化问题与空间先验实现非冗余的Token选择。实验表明EADP在严格Token预算下提高了VLM的精度-效率平衡,在多个多模态基准上达到SoTA性能。论文EADP视觉语言模型Token剪枝推荐理由:这篇论文用熵过滤噪声、子模选择保留细节,在VLM加速上效果不错,适合想优化推理效率的人看看。原文稍后读已读值得跟进有用关注 EADP
09:43官方账号arXiv cs.AI@Duy Tran Thanh论文提出MagikaDocumentFromPixel,一个轻量级CPU图像质量门,在单个CPU核上约7ms判断图像为清晰、模糊或不确定。基于46配置8扫描经验搜索,发现输入分辨率是主导杠杆。引入边缘先验模块(EPM),通过拉普拉斯幅度辅助输入使F1提升1.3点。在GoPro Large帧上以384x384训练,F1达0.9803(AUC 0.9989),ONNX模型仅17 MB。局限性包括仅针对单一运动模糊分布和单次种子结果。论文MagikaDocumentFromPixelMobileNetV3-LargeEPM推荐理由:这论文搞了个超轻量的图像模糊检测模块,7毫秒就能判断,能帮下游视觉语言模型省掉很多无用计算。实测F1到0.98,模型才17MB,值得做生产管线的看看。原文稍后读已读值得跟进有用关注 MagikaDocumentFromPixel
13:55Geek@geekbb精选百度开源了一个基于DeepSeek-OCR升级的视觉语言模型OCR项目,支持一次性解析超长文档。该模型提供两种推理模式:gundam模式用于处理单张图片中的密集文字,base模式适用于多页文档或PDF。项目代码已在GitHub上发布,允许开发者直接使用。AI模型百度DeepSeek-OCR视觉语言模型推荐理由:百度开源的OCR模型,在DeepSeek-OCR上做了升级,能一次性处理超长文档和密集文字,两种模式很实用。原文稍后读已读值得跟进有用关注 百度
12:53官方账号arXiv cs.LG@Andrei Liviu Nicolicioiu, Sarvjeet Singh Ghotra, Morgane M. Moss, Aaron Courville论文提出一种自举的Self-Filtering方法,通过迭代训练CLIP模型并动态筛选数据混合来提升训练数据质量。该方法在不需要额外数据或预训练模型的情况下,平衡了高置信度干净样本与全分布多样样本。实验表明,经该方法过滤后的视觉语言数据集在下游任务上性能显著提升。该方法避免了传统启发式或依赖参考数据集的局限。论文CLIP数据选择自过滤推荐理由:这篇论文教你怎么自动筛选高质量训练数据,用CLIP自己迭代过滤,效果比手动搞还好,还不用额外数据。原文稍后读已读值得跟进有用关注 CLIP
10:53官方账号arXiv cs.AI@Yundaichuan Zhan, Minghe Gao, Zhongqi Yue, Wendong Bu, Wenqiao Zhang, Guoming Wang, Jisheng Dang, Juncheng Li, Siliang Tang, Yueting ZhuangSCOPE 提出一种自适应的符号规划框架,由 Symbolic Execution Simulator(SESim)和 Self-Adaptive Symbolic Memory(SASMem)两个模块协同工作。SESim 通过符号验证和实际执行反馈来 refine 行动计划和进化符号世界;SASMem 则将反馈蒸馏为可演化的符号知识。在开放环境实验中,SCOPE 使符号世界完整性提升,在环境扰动下计划成功率提高,并增强了跨任务泛化能力。AI模型SCOPE符号规划视觉语言模型推荐理由:搞机器人规划的朋友可以看看 SCOPE,它用符号执行加记忆更新解决开放世界符号不完整的老问题。原文稍后读已读值得跟进有用关注 SCOPE
10:15官方账号arXiv cs.AI@Shihao Ji, HongXi Li, Zihui Song, Mingyu LiLagrange提出基于掩码潜在场(MLF)的开放词汇稀疏驾驶框架,利用视觉语言模型(VLM)编码类无关目标提议为连续语义视觉标记。通过意图驱动的掩码交叉注意力模块过滤无关实体,将注意力解码为空间坐标上的隐式连续能量场。将决策制定为跨越该能量场的拉格朗日动作最小化问题,强制遵守车辆运动学并执行碰撞避免。在nuScenes和CODA基准上的离线评估显示,该框架实现了鲁棒、可解释且运动学可行的开放世界自主性。论文Lagrange自动驾驶视觉语言模型推荐理由:自动驾驶新框架Lagrange用掩码潜在场和VLM处理开放世界异常,比密集模型更高效,在nuScenes和CODA上表现不错。原文稍后读已读值得跟进有用关注 Lagrange
13:08官方账号arXiv cs.AI@Jiaju Han, Ben Zhang, Xuemeng Sun, Qike Zhang, Yuxian Dong, Chengyin Hu, Fengyu Zhang, Yiwei Wei, Jiujiang GuoFusionRS是用于遥感双模态视觉语言学习的首个大规模RGB-红外-文本数据集。它由超过100万对对齐的RGB和红外风格图像组成,每对包含场景描述和红外感知描述。基于FusionRS训练的CLIP-style和生成式VLM模型在RGB-红外对齐、红外-文本检索和双模态描述任务上均优于纯RGB训练基线。消融实验表明,红外感知描述对强化红外-语言对齐至关重要。AI模型FusionRSRGB-红外遥感数据集推荐理由:FusionRS填补了RGB-红外双模态遥感数据集的空白,用公开RGB图转红外风格,加上两种描述,让模型同时理解可见光和红外信息。原文稍后读已读值得跟进有用关注 FusionRS
11:38官方一手arXiv: OpenAI@Marta Vallejo, Siwen Wang该研究通过十名参与者观看33张安全风险场景图像的眼动数据,生成人口平均注视热图。使用GPT-4o通过OpenAI Vision API生成视觉注意力显著性图,并与注视数据比较。空间对齐评估采用四个指标:皮尔逊相关系数0.515±0.117、NSS 0.988±0.323、KL散度1.766±0.844、AUC-Judd 0.806±0.076。与Gemini Pro、Gemini Flash和Claude的对比显示,所有模型AUC-Judd超过机会基线0.5且NSS为正。Gemini Pro在三个指标上定位最强,GPT-4o在KL散度上分布匹配最佳。论文GPT-4oGemini ProGemini Flash10 个信源在谈事件专题推荐理由:想知道AI能不能像人一样在危险场景下抓住关键区域?这篇论文用GPT-4o、Gemini Pro等模型做了对比,发现它们不靠眼动训练数据就能大致预测人类注视点。原文稍后读已读值得跟进有用关注 GPT-4o
11:12官方账号arXiv cs.AI@Jianzhe Lin论文发现验证器驱动的自DPO方法在视觉语言模型自改进中存在任务特异性问题。在MathVista、MMMU和BLINK上用开源验证器阶梯测试,同一验证器在MathVista上提升Qwen-3-VL-2B学生模型,但在MMMU上验证器准确率降至8%-23%,导致学生模型性能下降3.4-10.9个百分点。该现象在Qwen-2.5-VL-3B上复现。论文给出基于方差定理的机械论解释,指出目标任务验证器质量而非参数量才是关键。论文Qwen-3-VL-2BMathVistaMMMU推荐理由:验证器在新任务上会拖后腿原文稍后读已读值得跟进有用关注 Qwen-3-VL-2B
16:13官方一手marktechpost@Asif RazzaqZyphra 发布了 Zamba2-VL 系列开源视觉语言模型,包含 1.2B、2.7B 和 7B 三个参数版本。该模型采用混合 Mamba2 状态空间和 Transformer 骨干架构,在 Apache 2.0 许可下发布。与同类 Transformer 视觉语言模型相比,Zamba2-VL 在保持竞争力的同时,将首 token 生成时间降低了约一个数量级。这标志着在高效视觉语言推理方面的重要进展,尤其适合对延迟敏感的应用场景。AI模型视觉语言模型Mamba2Transformer推荐理由:做视觉语言模型部署或实时推理的开发者,Zamba2-VL 的首 token 延迟优势能显著提升用户体验,值得直接尝试。原文稍后读已读值得跟进有用关注 视觉语言模型
11:30官方账号arXiv cs.AI@Cheng-Yu Yang, Shao-Yuan Lo, Yu-Lun Liu精选视觉语言模型(VLM)将图像投影为数百到数千个视觉令牌,导致解码器推理成本高昂。现有方法通常采用“排序并移除”范式,永久丢弃低分令牌。但研究发现,视觉令牌的重要性会随解码器深度变化,早期低分令牌可能在后续层变得重要。为此,研究者提出Reroute,一种无需训练的插件,将移除改为可恢复路由:被延迟的令牌在后续阶段重新进入候选池。该方法在FastV、PDrop等方案上,在LLaVA-1.5和Qwen骨干上,在激进令牌缩减下提升了接地性能,同时保持VQA性能。这表明VLM令牌缩减应视为可恢复路由,而非不可逆修剪。代码已开源。论文视觉语言模型令牌缩减可恢复路由推荐理由:VLM推理成本高是实际部署的痛点,Reroute用零训练代价解决了令牌缩减中信息丢失的问题,做多模态模型优化或部署的团队可以直接集成到现有方案中,值得一试。原文稍后读已读值得跟进有用关注 视觉语言模型
11:32官方账号arXiv cs.AI@Mahmood Alzubaidi, Uzair Shah, Raden Muaz, Ines Abbes, Nader Mohammed, Abdullatif Magram, Khalid Alyafei, Mowafa Househ, Marco Agus精选FADA 是一个基于 Qwen3.5-VL 构建的统一视觉语言模型,能够通过单一流程完成胎儿超声图像的临床解读、分类、检测和分割,无需外部标签。它通过选择性蒸馏技术从四个领域专用基础模型中提取知识,在分割任务上达到 0.8820 平均 Dice,检测 mAP@0.50 为 0.7671,解读合规率 100%。专家验证显示,在 237 张图像上,临床指导模式下 73.5% 的解读获得满分。该系统可在单张消费级 GPU 上训练,并能在搭载骁龙 7 Gen 1 的智能手机上离线运行完整流程约 60 秒,为资源受限地区的产前超声筛查提供了可行方案。AI模型FADAQwen3.5-VL胎儿超声推荐理由:FADA 解决了中低收入国家超声技师短缺导致的产前筛查缺口,做医疗 AI 或边缘部署的团队可以直接在手机上跑完整流程,值得关注其开源代码和模型。原文稍后读已读值得跟进有用关注 FADA
10:07官方账号arXiv cs.AI@Peiqi Jia, Haonan Jia, Ziqi Miao, Linkang Du, Yuntao Wang, Zhou Su精选该论文首次在视觉语言模型(MLLMs)中引入显式人格条件,建立了涵盖单人格诱导、多人格诱导和人格切换的系统评估框架。实验发现,人格诱导能提升图像描述性能,但会损害需要精确推理的任务(如视觉问答)。多人格组合和动态切换时存在平衡与残留效应,模型行为受前后人格约束共同调节。现有基于提示的人格诱导方法在多模态场景下迁移性有限。研究揭示了MLLMs人格建模的动态复杂性,呼吁开发更鲁棒、定制化的方法。论文视觉语言模型人格建模多模态推荐理由:做多模态AI行为控制或社交机器人开发的团队,这篇论文揭示了人格诱导对推理能力的意外损害,值得在模型部署前仔细评估。原文稍后读已读值得跟进有用关注 视觉语言模型
11:17官方账号arXiv cs.AI@Cong Chen, Guo Gan, Kaixiang Ji, ChaoYang Zhang, Zhen Yang, Guangming Yao, Hao Chen, Jingdong Chen, Yi Yuan, Chunhua ShenMemDreamer 是一种新型框架,通过解耦感知与推理,将长视频理解转化为智能体探索过程。它采用分层图记忆架构,将视频流增量构建为三层语义抽象,并利用智能体工具增强检索机制,在推理时通过观察-推理-行动循环导航节点和逻辑边。实验表明,MemDreamer 在四个主流基准测试中达到最先进水平,与人类专家的差距缩小至仅 3.7 分。它仅使用全上下文 2% 的推理窗口,却带来 12.5 分的绝对准确率提升。此外,统计发现视觉语言模型在逻辑推理与长视频理解性能间存在强正线性相关,表明智能体能力扩展是多模态理解的新范式。论文长视频理解智能体检索分层图记忆推荐理由:长视频理解一直受限于 token 爆炸和注意力稀释,MemDreamer 用智能体检索和分层记忆解决了这个痛点。做视频分析、多模态研究的团队可以直接参考其框架,在现有模型上即插即用,值得一试。原文稍后读已读值得跟进有用关注 长视频理解
09:30官方账号arXiv cs.AI@Sweta Mahajan, Sukrut Rao, Jiahao Xie, Alexander Koller, Bernt SchieleCLIP等视觉语言模型存在图文嵌入对齐差的问题,因为图像包含的信息远超其标题描述。TEVI框架利用稀疏自编码器解耦图像嵌入,并训练掩码模块根据标题选择性重建嵌入,从而保留标题描述的特征、丢弃无关信息。在合成标题的受控实验中,TEVI能有效保留标题描述的属性。在MS COCO、Flickr、IIW、DOCCI等基准测试中,TEVI提升了检索性能,尤其在长标题任务上增益更明显,同时增强了RoCOCO基准的鲁棒性。论文CLIP稀疏自编码器图文对齐推荐理由:CLIP用户常遇到图文检索不准的痛点,TEVI用稀疏自编码器精准对齐嵌入,做多模态检索或视觉问答的团队可以直接参考其方法改进模型。原文稍后读已读值得跟进有用关注 CLIP
12:39官方账号arXiv cs.LG@Tengfei Zhang, Ziheng Zhao, Lisong Dai, Xiaoman Zhang, Pengcheng Qiu, Ya Zhang, Yanfeng Wang, Weidi Xie精选该研究提出了一个实体感知的跨图像比较推理框架 MedReCo,用于解决放射科实践中依赖前后对比和参考病例的诊断需求。研究构建了 MedReCo-DB 大规模数据集,包含来自 8 家机构、4 个国家、7 种影像模态的 69 万张图像,并将报告分解为解剖结构、异常发现和病理条件。基于此,开发了用于可控检索的 MedReCo 编码器和用于生成式比较解读的 MedReCo-VLM 视觉语言模型。在内部、外部和跨中心评估中,MedReCo 在 12 项内部检索设置中均取得最高 Recall@1,外部检索平均提升 6 个百分点;MedReCo-VLM 在比较生成评估中全面最优,纵向随访准确率提升 14.5-46.5 个百分点(胸片)和 13.0-27.9 个百分点(CT)。这表明实体感知的比较推理可从常规临床数据中大规模学习,为医学影像 AI 提供更贴近临床的范式。论文医学影像比较推理视觉语言模型推荐理由:放射科医生和医学影像 AI 研究者终于有了一个能真正做前后对比和参考病例检索的框架——MedReCo 在 12 项检索任务中全胜,做临床 AI 落地的团队值得关注。原文稍后读已读值得跟进有用关注 医学影像
12:49Fireworks AI@FireworksAI_HQ精选72°Step 3.7 Flash 是阶跃星辰(StepFun)发布的 198B 稀疏 MoE 视觉语言模型,专为推理效率从头设计。该模型包含 196B 语言骨干和 1.8B 视觉编码器,支持原生多模态理解和行动,可靠工具使用,以及增强的网页和视觉搜索。在真实智能体工作负载下,推理速度可达 400 tok/sec,并采用 Apache 2.0 开源许可。Fireworks AI 已提供在线试用。AI模型视觉语言模型稀疏MoE推理效率1 个信源在谈事件专题推荐理由:多数实验室事后才考虑推理效率,而 Step 3.7 Flash 从设计之初就为推理优化,做智能体应用和视觉语言模型的开发者可以直接试用,感受 400 tok/sec 的流畅体验。原文稍后读已读值得跟进有用关注 视觉语言模型
10:58官方账号arXiv cs.AI@Mahtab Bigverdi, Lindsey Li, Weikai Huang, Yiming Liu, Jaemin Cho, Jieyu Zhang, Tuhin Kundu, Chris Dangjoo Kim, Zelun Luo, Linda Shapiro, Ranjay Krishna多模态语言模型在空间推理任务中常因无法直接观察关键信息而表现不佳。研究者提出 Imaginative Perception Tokens (IPT),一种中间感知表征,让模型能推断未观察到的空间结构,如从不可见视角看物体、追踪遮挡路径等。在 Perspective Taking、Path Tracing 和 Multiview Counting 三个任务上,IPT 监督显著提升空间推理准确率,在 MVC 上提升 3.4%,且优于文本思维链训练。研究发现文本思维链在空间计算中可能因模态不匹配而降低性能,而 IPT 提供了更有效的监督信号。该方法无需在推理时生成图像,即可产生可解释的中间表征,提升泛化能力。论文空间推理多模态模型Imaginative Perception Tokens推荐理由:空间推理是多模态模型的短板,IPT 提供了一种不依赖文本思维链的监督方式,做视觉推理或空间理解的团队可以直接参考论文方法。原文稍后读已读值得跟进有用关注 空间推理
10:43官方账号arXiv cs.LG@Hanjiang Hu, Yiyuan Pan, Jiaxing Li, Xusheng Luo, Alexander Robey, Na Li, Yebin Wang, Changliu Liu精选VLESA 是一个面向具身 AI 的安全框架,通过分析第一人称视频实时预测危险动作并触发干预。它解决了“意图依赖的安全”问题——相同动作在不同情境下可能安全或危险。研究团队引入了配对第一人称帧与目标条件安全标注的数据集,并训练了基于 GRPO 的目标条件安全 Q 过滤器,无需重新训练即可评估动作安全性。在 ASIMOV-2.0 基准上,VLESA 在精确帧上实现了更高的干预准确率,GRPO 训练的 Q 过滤器通过目标条件约束解码将动作安全性提升了超过 41 个百分点。代码已开源。论文具身智能安全监控视觉语言模型推荐理由:做具身 AI 安全或人机协作的团队,VLESA 提供了一个可落地的实时安全监控方案,能根据上下文判断危险动作,建议直接看论文和代码。原文稍后读已读值得跟进有用关注 具身智能
12:04官方账号arXiv cs.AI@Hilton Raj, Vishnuram AVMASER 提出了一种轻量级框架,解决现有视觉语言模型(VLM)在3D环境中仅针对单一模态微调、忽略问题语义可能更适合其他模态的问题。该框架在共享VLM骨干上训练五个不同模态适配器(自然语言、RGB图像、点云、深度图、相机姿态),并通过神经路由策略在推理时根据问题选择最优适配器。在Open3D-VQA基准测试中,点云模态在51.5%情况下最优,MASER的路由准确率达到51.3%的oracle一致性,优于随机森林的43.5%,且每次推理仅需一次适配器调用。这项工作为具身智能体在3D空间中的多模态推理提供了高效解决方案。论文具身智能3D空间智能多模态路由推荐理由:做具身智能或3D视觉问答的团队,终于有了一个不用暴力融合所有模态的轻量方案——MASER根据问题语义动态选最优模态,点云在超半数场景下最准,值得在Open3D-VQA上试试。原文稍后读已读值得跟进有用关注 具身智能