11:00官方账号arXiv cs.AI@Chunyang Jiang, Pingping Zhang, Yuzhi Zhao, Wenao Ma, Zhijian Hou, Mengyang Wu, Yiyang Cai, Senkang Hu, Sitong Cheng, Chi-Min Chan, Wei Xue, Yike GuoFISA 框架从模型自身的失败案例中生成增强图像,避免使用与模型短板脱节的通用变换。该方法通过自检验和双重保真过滤,在保持答案正确的同时提升图像复杂度。在视觉问答基准上的实验表明,FISA 能持续改进分布内与分布外性能,并与现有文本自增强方法兼容。其合成样本的数据效率也优于通用图像增强基线。论文FISA多模态大语言模型图像增强推荐理由:这篇讲FISA,拿模型答错的题来造新训练图,比瞎做增强更准,还能和文本增强一起用。原文稍后读已读值得跟进有用关注 FISA
10:34官方账号arXiv cs.AI@Duzhen Zhang, Yahan Yu, Qiaoyi Su, Jiahua Dong, Tielin Zhang多模态大语言模型(MLLM)依赖投影仪对齐视觉表示与语言嵌入空间。在持续指令微调中,视觉分布变化和指令语义演化导致投影仪漂移,引发投影仪级别遗忘——现有方法主要关注LLM骨干而忽视该问题。本文提出PMA框架,通过轻量级表示描述符检测多模态分布偏移,按需渐进扩展投影仪专家,并保留原始预训练投影仪作为稳定锚点。在两个MCIT基准(如MMBench持续版本)上,PMA结合现有方法一致超越先前最优结果,且在不同MLLM骨干上表现鲁棒。论文多模态大语言模型持续指令微调投影仪对齐推荐理由:这篇论文发现多模态模型持续微调时,投影仪会比主干更容易遗忘旧知识,并提出了PMA框架来解决,在两个基准上效果超过现有方法,值得做持续学习的读者看看。原文稍后读已读值得跟进有用关注 多模态大语言模型
17:12IT之家(博客/媒体)抖音集团7月27日宣布全面升级未成年人模式的适龄推荐算法,核心是引入多模态大语言模型(MLLM)技术,实现跨模态语义理解。该模型可综合处理文本、图像、音频等信息,评估内容的认知复杂度与价值观,为每条视频标注适宜年龄。平台通过“人工筛选+大模型分类+适龄推荐+内容偏好匹配”机制,目前专属内容池日均新增约6000条优质内容,总量达770万条,并根据不同年龄段(如精细化解码)进行差异化推荐。AI产品抖音多模态大语言模型推荐算法推荐理由:抖音用多模态大模型给娃推内容,日均筛6000条优质视频,总量770万,还分年龄段推荐,家长可以放心了。原文稍后读已读值得跟进有用关注 抖音
11:06官方账号arXiv cs.LG@Sanghyuk Chun, William Yang, Amaya Dharmasiri, Olga RussakovskyCoMet是一种针对多模态大语言模型(MLLM)的不确定性估计方法,将不确定性分解为上下文项和多样性项,分别捕捉任务或提示引发的歧义以及上下文确定的合理答案数量。该方法训练一个轻量级后验不确定性模块,无需自回归生成答案或重复采样即可高效估计不确定性。在多个开放多模态基准测试、幻觉检测和多项选择VQA基准上,CoMet持续优于现有基线,且保持计算效率。代码已开源。论文CoMet不确定性估计多模态大语言模型推荐理由:这篇论文提出了CoMet,能高效估计多模态语言模型的不确定性,比现有方法更准更快,很适合做AI可靠性的研究者看。原文稍后读已读值得跟进有用关注 CoMet
11:03官方账号arXiv cs.AI@Junhao Chen, Chanyu Zhu, Zheqi Lv, Keting Yin, Shengyu Zhang自回归视觉模型(AVM)基于下一尺度预测进行图像和视频合成,但语义错误易累积。现有免训练方法忽略中间生成状态,导致错误未被诊断。Gazer框架引入多模态大语言模型反馈,在AVM采样循环中通过反思诊断和语义修正两个阶段实时纠正错误。在组合图像和视频基准测试中,Gazer提升了多个AVM的语义对齐和组合准确性,无需额外训练。论文GazerAVMs多模态大语言模型推荐理由:这个框架不用重训模型,就能在图片和视频生成时自动修语义错,比之前的免训练方法更靠谱。原文稍后读已读值得跟进有用关注 Gazer
09:28官方账号arXiv cs.AI@Jiahao Meng, Yue Tan, Qi Xu, Kuan Gao, Weisong Liu, Yanwei Li, Jason Li, Lingdong Kong, Haochen Wang, Qianyu Zhou, Jiangning Zhang, Guangliang Cheng, Yunhai Tong, Lu Qi, Minghsuan Yang这篇综述从人类视角出发,系统梳理了多模态大语言模型(MLLM)在视频理解中的三大核心能力:观看(感知)、记忆(上下文保持)和推理(生成可靠输出)。文章提出统一框架,将视频理解系统分解为感知表征、记忆状态、推理轨迹和最终预测,并分析了时空感知、长视频高效处理、流式理解、忠实推理等关键挑战。作者按功能分类介绍了代表性方法,涵盖细粒度感知、多模态对齐、离线/流式记忆、纯文本与视频推理等方向,并讨论了第一人称、体育、教学、医疗等应用场景及评估基准。最后指出了可扩展、记忆感知、证据驱动的视频智能的未来方向。论文多模态大语言模型视频理解综述推荐理由:做视频理解或 MLLM 研究的同学,这篇综述帮你把碎片化的方法统一到“观看-记忆-推理”框架下,省去自己梳理文献的时间,值得收藏作为 roadmap。原文稍后读已读值得跟进有用关注 多模态大语言模型
11:59官方账号arXiv cs.LG@Yu-Cheng Shi, Zhen-Hao Xie, Jun-Tao Tang, Da-Wei Zhou多模态大语言模型(MLLMs)通过指令微调表现出色,但实际部署需要持续获取新的视觉语言能力,因此多模态持续指令微调(MCIT)至关重要。现有方法常采用稀疏架构(如混合LoRA专家)通过图像-文本相似度路由,但任务响应结构不同时可能共享高度相似的语义,导致路由错误和梯度干扰。ProtoAda提出格式感知的任务原型,将任务分配与路由对齐到语义和输出结构,并通过几何感知方式整合格式兼容的更新,有效重用和优化现有参数。实验表明,ProtoAda在多个基准上表现优异,尤其对答案结构易被顺序微调破坏的任务效果显著。论文多模态大语言模型持续学习指令微调推荐理由:做多模态持续学习的团队终于有了解决任务路由混乱的方案——ProtoAda通过原型感知输出结构,避免VQA和接地任务互相污染,建议关注论文中的几何整合细节。原文稍后读已读值得跟进有用关注 多模态大语言模型
12:20官方账号arXiv cs.LG@Jun-Tao Tang, Yu-Cheng Shi, Zhen-Hao Xie, Da-Wei Zhou精选多模态大语言模型(MLLMs)通过指令调优将多样任务统一为指令遵循框架,但实际部署需要持续适应新任务,这催生了多模态持续指令调优(MCIT)。然而,当前MCIT研究受限于工程瓶颈:现有方法通常直接修改基础MLLM代码库,导致实现开销大、架构特定、代码复用和公平比较困难。为此,研究者提出Prism,一个插件式可复现代码库,通过轻量级插件注册机制将算法开发与骨干实现分离,无需修改底层MLLM代码即可集成新策略。Prism原生支持大规模训练流水线,确保可复现和可扩展的MCIT实验。代码已开源。论文多模态大语言模型持续学习指令调优推荐理由:Prism解决了MCIT研究中代码碎片化和复现难的问题,做多模态持续学习的团队可以直接用这个插件式框架加速实验,省去大量工程重复劳动。原文稍后读已读值得跟进有用关注 多模态大语言模型
11:44官方账号arXiv cs.AI@Shuhong Zheng, Aashish Kumar Misraa, Yu-Teng Li, Yu-Jhe Li, Igor Gilitschenski主体驱动图像生成旨在根据文本指令生成保留给定主体身份的新图像。现有方法通常分别编码文本和参考图像,限制了跨模态推理能力并导致复制粘贴伪影。本文提出了一种新框架,通过将扩散模型与多模态大语言模型(MLLM)结合,并引入基于VAE的身份条件,实现了文本指令与身份保留的平衡。其中,双层级聚合(DLA)模块用于融合MLLM的多层特征,多阶段去噪策略在推理时逐步平衡语义信息与细节身份。实验表明,该方法在主体驱动图像生成中优于现有方法,有效缓解了复制粘贴问题,并更符合人类偏好。论文多模态大语言模型主体驱动生成扩散模型推荐理由:做图像生成或AI绘画的开发者,这篇论文解决了主体身份保留与文本指令跟随的长期矛盾,提出的DLA模块和多阶段去噪策略可以直接参考,值得点开看看具体实现。原文稍后读已读值得跟进有用关注 多模态大语言模型
11:15官方账号arXiv cs.AI@Rim Assouel, Amir Bar, Michal Drozdzal, Adriana Romero-Soriano精选多模态大语言模型在细粒度视觉理解上仍有不足。研究者提出PGT框架,通过在图像上叠加几何基元生成密集监督信号,分离视觉定位与语义先验。实验显示,在LLaVA-v1.5-Instruct上加入PGT数据后,What'sUp基准提升20%,CV-Bench-2D提升13.3%,且不影响通用感知能力。在先进MLLM上微调也带来最高8.3%的提升。结果表明,许多空间推理缺陷源于监督信号不足,而非架构或分辨率限制。论文多模态大语言模型视觉定位数据增强推荐理由:PGT用低成本数据生成解决了MLLM细粒度视觉理解的瓶颈,做多模态模型训练或评估的团队可以直接用这个框架提升定位能力,值得一试。原文稍后读已读值得跟进有用关注 多模态大语言模型