10:43官方账号arXiv cs.LG@Hanjiang Hu, Yiyuan Pan, Jiaxing Li, Xusheng Luo, Alexander Robey, Na Li, Yebin Wang, Changliu Liu精选VLESA 是一个面向具身 AI 的安全框架,通过分析第一人称视频实时预测危险动作并触发干预。它解决了“意图依赖的安全”问题——相同动作在不同情境下可能安全或危险。研究团队引入了配对第一人称帧与目标条件安全标注的数据集,并训练了基于 GRPO 的目标条件安全 Q 过滤器,无需重新训练即可评估动作安全性。在 ASIMOV-2.0 基准上,VLESA 在精确帧上实现了更高的干预准确率,GRPO 训练的 Q 过滤器通过目标条件约束解码将动作安全性提升了超过 41 个百分点。代码已开源。论文具身智能安全监控视觉语言模型推荐理由:做具身 AI 安全或人机协作的团队,VLESA 提供了一个可落地的实时安全监控方案,能根据上下文判断危险动作,建议直接看论文和代码。原文稍后读已读值得跟进有用关注 具身智能
12:04官方账号arXiv cs.AI@Hilton Raj, Vishnuram AVMASER 提出了一种轻量级框架,解决现有视觉语言模型(VLM)在3D环境中仅针对单一模态微调、忽略问题语义可能更适合其他模态的问题。该框架在共享VLM骨干上训练五个不同模态适配器(自然语言、RGB图像、点云、深度图、相机姿态),并通过神经路由策略在推理时根据问题选择最优适配器。在Open3D-VQA基准测试中,点云模态在51.5%情况下最优,MASER的路由准确率达到51.3%的oracle一致性,优于随机森林的43.5%,且每次推理仅需一次适配器调用。这项工作为具身智能体在3D空间中的多模态推理提供了高效解决方案。论文具身智能3D空间智能多模态路由推荐理由:做具身智能或3D视觉问答的团队,终于有了一个不用暴力融合所有模态的轻量方案——MASER根据问题语义动态选最优模态,点云在超半数场景下最准,值得在Open3D-VQA上试试。原文稍后读已读值得跟进有用关注 具身智能
11:12官方账号arXiv cs.AI@Stefano Samele, Eugenio Lomurno, Teodora Jovanovic, Sanjay Shivakumar Manohar, Alberto Crivellaro, Matteo Matteucci工业异常检测领域近年引入多模态视觉语言模型,声称可通过文本指令实现零样本或少样本检测。但现有评估方法沿用单模态基准,无法验证模型是否真正依赖文本条件。本文提出TGAD结构化基准,通过三个递进场景测试:MVTec AD上的提示敏感性测试、组件级标注扩展、以及新构建的组装面板数据集APD。测试发现,三种代表性模型(生成式大视觉语言模型、无训练判别式、嵌入自适应判别式)均仅表面响应文本指令:移除物体名词后生成模型I-AUROC从97.4降至82.6;组件指令无法约束决策;在APD上图像级判别甚至低于随机水平(最低31.5)。结果表明当前多模态异常检测系统的文本引导能力被高估,需要此类基准才能实现工业部署所需的可靠语言控制。论文异常检测多模态基准测试推荐理由:做工业视觉检测的团队会发现,当前号称支持文本引导的模型其实并不听指令——TGAD基准直接戳破了这个泡沫,建议点开看看你的模型是否真的被语言控制。原文稍后读已读值得跟进有用关注 异常检测
09:42官方账号arXiv cs.AI@Bingyu Li, Da Zhang, Tao Huo, Zhiyuan Zhao, Junyu Gao, Xuelong Li精选多时序指代分割(MTRS)是一项新任务,要求模型从多时序图像中分割出语言描述的时间变化。研究团队提出了CRAFT-Agent自动化数据构建流程,并构建了首个基准MTRefSeg-21K,包含2.1万高质量三元组。现有视觉语言模型在该任务上表现不佳,为此团队提出了MTRefSeg-R1框架,采用两阶段训练策略,先学习通用时序变化感知,再微调实现细粒度语言引导定位。实验表明,MTRefSeg-R1显著优于现有基线,揭示了多时序视觉推理的挑战与潜力。论文多时序推理指代分割视觉语言模型推荐理由:做多模态视觉推理或时序变化检测的团队,这个新基准和基线模型值得关注——它填补了LVLM在时序推理上的空白,可以直接用来评估和提升模型能力。原文稍后读已读值得跟进有用关注 多时序推理
10:38官方账号arXiv cs.AI@Arnau Marin-Llobet, Simon Henniger, Mahzarin R. Banaji精选研究发现,视觉语言模型(VLM)在处理性别模糊的图像(如全副武装的工人、背影)时,即使内部编码了女性关联,输出仍倾向于男性,尤其在传统女性职业上表现明显。研究者提出零样本指标LALS,通过将视觉token激活投影到文本嵌入空间,逐层测量概念关联。实验覆盖15个职业、800多张模糊图像和4个VLM,发现模型内部存在不对称过滤:男性信号从头到尾增强,女性信号在中间层达到峰值后被压制。服装颜色等文化线索会进一步调节内部关联。这项研究揭示了VLM在模糊输入下的性别偏见机制,对AI公平性评估有重要启示。论文视觉语言模型性别偏见LALS推荐理由:做AI公平性研究或模型对齐的团队,这篇论文直接戳破了VLM在模糊输入下的性别偏见黑箱——LALS方法让你能逐层看到模型内部编码与输出的脱耦,建议做模型审计的开发者点开看看具体实验设计。原文稍后读已读值得跟进有用关注 视觉语言模型
05:27官方一手marktechpost@Asif RazzaqStepFun 发布了 Step 3.7 Flash,一个 198B 参数的 MoE(混合专家)视觉语言模型,原生支持视觉理解、256k 上下文窗口和 Advisor Mode(顾问模式)。该模型针对编程智能体和搜索工作流进行了优化,能够在复杂任务中提供高效推理和代码生成能力。Step 3.7 Flash 的发布标志着多模态大模型在专业领域应用的重要进展,尤其适合需要长上下文理解和视觉-语言联合推理的场景。AI模型Step 3.7 FlashMoE视觉语言模型推荐理由:做 AI 编程智能体或搜索应用的团队可以直接用上 256k 上下文和视觉能力,Step 3.7 Flash 的 Advisor Mode 能显著提升复杂任务处理效率,值得关注。原文稍后读已读值得跟进有用关注 Step 3.7 Flash
11:05官方账号arXiv cs.AI@Xiaona Zhou, Muntasir Wahed, Tianjiao Yu, Constantin Brif, Ismini Lourentzou研究者发现现有视觉语言模型在时序异常检测任务上表现不佳,主要原因是公开数据集缺乏自然语言解释,难以微调模型。为此,他们构建了VisAnomBench基准,从公开时序数据中筛选并利用多个大模型生成高质量异常解释。基于此微调出参数高效的VisAnomReasoner模型,在VisAnomBench上精度和F1分别提升至少21.23和23.87个百分点,在TSB-AD-U基准上也展现出强泛化能力。这项工作让小型VLM在时序异常检测中变得可靠且可解释。论文时序异常检测视觉语言模型VisAnomReasoner推荐理由:时序异常检测终于有了可解释的小模型方案,做工业监控或运维分析的团队可以直接用VisAnomReasoner替代大模型,精度更高、成本更低,建议点开看具体微调方法。原文稍后读已读值得跟进有用关注 时序异常检测
11:49官方账号arXiv cs.AI@Xinrui Shi, Kai Liu, Ziqing Zhang, Jianze Li, Anqi Li, Yulun Zhang精选轻量级视觉语言模型在标准基准上表现不错,但在需要多步推理的密集场景中(如多个物体、属性、关系)系统性地失败。为此,研究者首先构建了DRBench基准,包含14,573个问题、2,943张图像,覆盖5类任务和3个推理层次。然后提出DRScaffold框架,通过将监督目标分解为四个因果有序阶段,在不改动模型架构的情况下强制进行有依据的推理。实验表明,使用DRScaffold训练的Qwen2.5-VL-3B在DRBench上超越了冻结的Qwen2.5-VL-32B,证明结构化监督可以替代大量模型规模。代码和模型已开源。论文视觉语言模型密集场景推理DRBench推荐理由:轻量级VLM在复杂场景中经常胡编乱造,DRScaffold用结构化监督解决了这个痛点,做视觉推理或部署小模型的团队可以直接用它的框架和基准来提升可靠性。原文稍后读已读值得跟进有用关注 视觉语言模型
11:18官方账号arXiv cs.AI@Jiarui Guo, Haojia Wei, Yiming Zhang, Yifei Liu, Yuning Gong, Hongjie Zhang, Xue Yang, Zhihang Zhong精选PhotoFlow 提出了一种基于智能体的虚拟摄影框架,能够在无预设相机位姿或参考图像的情况下,根据语言指令在3D场景中自动选择相机参数并渲染照片。该框架包含导演、评审和反思三个模块,通过闭环搜索优化拍摄效果。同时发布了 VPhotoBench 基准,包含47个场景和141个语言条件摄影任务。实验表明,PhotoFlow 在六轮渲染预算下,成功率和质量对齐指标均优于现有方法。这是首个将语言条件虚拟摄影作为可执行智能体任务的工作。论文智能体3D场景理解虚拟摄影推荐理由:做3D场景理解或自动摄影的团队,PhotoFlow 把语言指令到相机参数的全流程打通了,可以直接用它的闭环搜索思路提升自己的渲染管线。原文稍后读已读值得跟进有用关注 智能体
11:13官方账号arXiv cs.AI@Jianshu Zhang, Yijiang Li, Huifeixin Chen, Haoran Lu, Letian Xue, Bingyang Wang, Han Liu精选该研究通过SpaceNum框架系统评估了视觉语言模型(VLMs)在空间数值理解上的表现,包括动态探索和静态布局两种场景。实验发现,当前VLMs在将视觉空间结构与语言数值表示进行映射时,表现接近随机猜测,严重依赖浅层空间线索。模型难以建立稳定的坐标感知表示,也无法从视觉观察中抽象出结构化空间布局。即使加入显式推理或微调,提升也有限。这项研究揭示了VLMs在具身环境中输出数值(如动作幅度、空间坐标)时,可能并未真正理解其空间含义。论文视觉语言模型空间推理数值理解推荐理由:做具身智能或空间推理的开发者会发现,当前VLMs的数值输出可能只是“看起来对”,实际缺乏空间感知——这项研究用严谨实验戳破了这个盲区,值得关注。原文稍后读已读值得跟进有用关注 视觉语言模型
09:54官方账号arXiv cs.LG@Bo Peng, Jie Lu, Guangquan Zhang, Zhen Fang本文提出一种去偏负样本挖掘方法,用于改进基于预训练视觉语言模型(VLM)的分布外(OOD)检测。现有方法依赖启发式规则从无标签语料中挖掘负标签,但存在严重的假负样本问题。作者通过理论框架校正负标签的采样偏差,将其转化为基于 ID 标签和无标签语料的蒙特卡洛采样。实验表明,该方法在多种 OOD 检测设置下达到新的最优性能。代码已开源。论文OOD 检测视觉语言模型负样本挖掘推荐理由:做 OOD 检测或 VLM 应用的开发者,这篇解决了负样本挖掘的假负问题,理论扎实且效果显著,值得直接参考代码复现。原文稍后读已读值得跟进有用关注 OOD 检测
11:21官方账号arXiv cs.AI@Yakun Yu, Ashley Wiens, Adrián Barahona-Ríos, Benedict Wilkins, Saman Zadtootaghaj, Nabajeet Barman, Cor-Paul Bezemer精选现有视觉语言模型(VLM)在游戏故障检测评估中,大多将故障视为静态视觉异常,忽略了时间性故障——这类故障需通过帧间变化才能识别。研究者提出TempGlitch基准,包含五种时间性故障类型及配对的无故障视频,用于系统评估。对12个开源和闭源VLM的测试显示,当前模型在TempGlitch上表现接近随机,要么过于保守漏检,要么过于敏感误报。增加帧采样密度或模型规模并不能可靠解决这些问题。该基准为时间推理、游戏理解和自动化故障检测提供了聚焦测试平台。论文视觉语言模型游戏QA故障检测推荐理由:游戏QA团队和VLM研究者终于有了专门测试时间性故障的基准——当前模型表现接近随机,说明这是个硬骨头,做自动化测试的值得关注。原文稍后读已读值得跟进有用关注 视觉语言模型
09:46官方账号arXiv cs.AI@Yutong Xie, Zhenglin Hua, Ran Wang, Wing W. Y. Ng, Xizhao Wang, Yuheng Jia精选大型视觉语言模型(LVLMs)在视觉语言任务中表现出色,但仍易产生与视觉内容不一致的幻觉。研究发现,幻觉源于模型对正确视觉证据关注不足,并在生成过程中逐渐遗忘。作者提出基于层间视觉注意力差异(ILVAD)的无需训练方法,通过识别并增强对视觉证据的注意力,同时选择与视觉证据强相关的文本token进行强调。在五个最新模型上的多项基准测试中,该方法一致地缓解了幻觉,且即插即用。代码已开源。论文幻觉缓解视觉语言模型注意力机制推荐理由:做LVLM幻觉研究的开发者可以直接用这个无需训练的方法来提升模型可靠性,代码已开源,值得一试。原文稍后读已读值得跟进有用关注 幻觉缓解
16:00官方账号arXiv cs.AI@Zhefan Xu, Ghassen Jerfel, Marina Haliem, Qi Zhao, Jeonhyung Kang, Khaled S. Refaat精选本文提出 VL-DPO 框架,利用视觉语言模型(VLM)作为零样本推理器,自动从预训练模型的轨迹输出中生成偏好对,再通过直接偏好优化(DPO)微调运动预测模型,使其与人类驾驶偏好对齐。在 Waymo Open End-to-End Driving Dataset 上实验表明,VLM 的轨迹选择可作为人类偏好的高质量代理,最终模型在评分反馈(RFS)上提升 11.94%,平均位移误差(ADE)降低 10.01%。该方法解决了标准模仿学习难以捕捉人类驾驶偏好细微差异的问题,为自动驾驶行为决策提供了新的对齐思路。论文自动驾驶偏好对齐视觉语言模型推荐理由:自动驾驶团队终于有了一个自动对齐人类偏好的实用方法——用 VLM 生成偏好对再微调,比手工标注高效太多,做运动预测或决策规划的开发者值得一试。原文稍后读已读值得跟进有用关注 自动驾驶
09:43IT之家(博客/媒体)精选微信AI团队模式识别中心在ICASSP 2026上凭借论文《Less Redundancy: Boosting Practicality of Vision Language Model in Walking Assistants》获得最佳工业论文奖,这是该奖项自2016年设立以来首次颁给中国企业团队。论文提出WalkVLM-LR模型,专为视障人士行走辅助设计,核心创新在于减少输出冗余和时间冗余,解决“何时该提醒”的问题。目前延迟控制在百毫秒量级,实时性已较可用,但仍有优化空间。该成果标志着中国企业在信号处理领域的技术突破。论文视觉语言模型信号处理微信AI推荐理由:微信AI团队解决了视障辅助场景中VLM“说太多”和“说太频繁”的痛点,做AI助残或边缘端VLM的开发者可以关注其减少冗余的思路,实时性已接近可用,值得点开了解技术细节。原文稍后读已读值得跟进有用关注 视觉语言模型
16:00berryxia@berryxia腾讯团队开源了Chronicles-OCR,一个专门用于评估VLLM对古汉字感知能力的基准数据集。该数据集覆盖从甲骨文到草书的3000年演变,包含7种历史字体、2800张来自真实载体的平衡图像。测试任务包括字符定位、细粒度识别、古文字解析和字体分类。结果显示,随着视觉分布的时间漂移,大多数模型的感知能力显著下降。这一工作将AI视觉能力与文化传承紧密结合,为古代历史研究提供了新的工具。论文古文字识别OCR视觉语言模型推荐理由:古文字识别是AI视觉的硬核边界,做OCR或文化遗产数字化的团队可以直接用这个基准测试自家模型,看看它们穿越回3000年前还能不能认出字。原文稍后读已读值得跟进有用关注 古文字识别
11:42官方账号arXiv cs.AI@Junming Liu, Yuqi Li, Yifei Sun, Maonan Wang, Piotr Koniusz, Yirong Chen, Ding Wang精选视觉语言模型(VLM)在空间推理上仍存在脆弱性,即使能正确回答原始输入,也可能在变换后失败。为此,研究者提出SAGE(Spatial Alignment via Geometric Evolution),一种自进化框架,通过几何和语言对偶操作强制VLM保持逻辑一致性。SAGE将一致性作为GRPO训练的辅助奖励,并动态调整操作池以聚焦最具信息量的信号。该方法模型无关、数据高效,可作为轻量后训练阶段应用于任何VLM。实验表明,SAGE在视频和空间推理基准上持续优于强基线,并提升了对未见数据的泛化能力。论文空间推理视觉语言模型自进化训练推荐理由:空间推理是VLM的硬伤,SAGE用自进化训练解决了这个痛点,做多模态模型训练或空间理解应用的团队可以直接参考方法。原文稍后读已读值得跟进有用关注 空间推理
11:28官方账号arXiv cs.AI@Pawat Chunhachatrachai, Gueter Josmy Faure, Hung-Ting Su, Winston H. Hsu精选SpatioRoute 是一种无需训练或微调的动态提示生成方法,用于提升视觉语言模型在零样本设置下对第一人称视频的空间问答能力。它通过规则或大语言模型驱动的路由,将每个问题映射到语义定制的提示模板,在 SQA3D 基准上相比固定提示基线提升高达 5% 的准确率,且无需 3D 点云输入。研究还发现,链式思维提示在 Qwen 系列模型上反而会降低性能,表明问题感知路由比统一推理指令更有效。论文零样本推理空间问答提示工程推荐理由:做零样本视频空间推理的团队终于有了一个即插即用的提升方案——SpatioRoute 无需额外训练就能涨点 5%,做 VLM 应用的开发者可以直接在 SQA3D 上试试。原文稍后读已读值得跟进有用关注 零样本推理
11:50官方账号arXiv cs.AI@Jin Shi, Brady Zhang, Yishun Lu精选VLA-AD提出一种蒸馏框架,利用视觉语言模型作为离线语义监督器,将大型VLA教师模型(如OpenVLA-7B)压缩为轻量级学生策略(158M参数),模型大小减少44倍,推理速度提升3.28倍(12.5 Hz on RTX 4090),性能仅下降0.27%。该方法不仅模仿底层动作,还引入任务阶段锚点和多帧操作方向描述等高层语义信号,仅在训练时使用,测试时学生策略独立运行。在LIBERO基准测试中,VLA-AD对π0.5-4B教师也有效,学生策略在部分任务上甚至超越教师。额外分析表明,语义引导使学生对教师动作噪声(如高频夹爪误操作)更鲁棒。论文VLA策略模型蒸馏机器人操控推荐理由:做机器人策略部署的团队终于有了实用的模型压缩方案——VLA-AD用VLM离线语义信号替代在线大模型,7B教师变158M学生,速度3倍提升且性能几乎无损,做实时闭环控制的开发者可以直接参考。原文稍后读已读值得跟进有用关注 VLA策略