5月20日
11:06
11:06官方账号arXiv cs.LG@Keanu Nichols, Divya Appapogu, Giscard Biamby, Dina Bashkirova, Anna Rohrbach, Bryan A. Plummer
精选
随着生成式 AI 的普及,图像篡改变得愈发容易,可能传播虚假信息。然而,现有研究缺乏针对不同视觉域中高级篡改的检测方法。为此,研究者提出了 AUDITS 基准,包含超过 53 万张来自用户和新闻照片的图像,利用扩散模型进行修复,支持对篡改类型、大小、质量及域迁移的多轴分析。实验评估了现有检测方法在不同域迁移下的鲁棒性,旨在推动更可靠、泛化的图像篡改检测研究。
推荐理由:图像篡改检测是 AI 安全的关键环节,AUDITS 为研究者提供了首个大规模多轴基准,做视觉取证或 AI 安全的人可以直接用它来评估和提升模型鲁棒性。
5月19日
11:01
11:01官方账号arXiv cs.LG@Grigory Bartosh, David Ruhe, Emiel Hoogeboom, Jonathan Heek, Thomas Mensink, Tim Salimans
精选
Dual-Rate Diffusion 提出了一种新的扩散模型加速方法,通过交错执行一个稀疏更新的重上下文编码器和一个轻量去噪模型来降低推理成本。重编码器每几步提取一次高维特征,轻量模型则在每一步复用这些特征进行高效去噪。在 ImageNet 基准上,该方法在保持生成质量的同时将计算成本降低 2-4 倍。此外,该方法与蒸馏技术(如 Moment Matching Distillation)兼容,可进一步加速少步生成。
推荐理由:扩散模型推理慢是落地痛点,Dual-Rate Diffusion 用轻量网络复用特征,做图像生成的团队可以直接拿来加速现有模型,效果不打折。
5月15日
5月14日
5月13日
19:12
19:12官方账号arXiv cs.AI@Guohui Zhang, XiaoXiao Ma, Jie Huang, Hang Xu, Hu Yu, Siming Fu, Yuming Li, Zeyue Xue, Lin Song, Haoyang Huang, Nan Duan, Feng Zhao
精选
OmniNFT 提出了一种面向联合音视频生成的扩散强化学习框架,解决了多目标强化学习中优势不一致、梯度失衡和信用分配不均三大问题。该方法通过模态级优势路由、层级梯度手术和区域级损失重加权,显著提升了音频和视频的感知质量、跨模态对齐和音视频同步。在 JavisBench 和 VBench 基准测试中,基于 LTX-2 骨干的 OmniNFT 实现了全面性能提升。该工作为多模态生成任务中的强化学习应用提供了新范式。
推荐理由:做多模态生成或音视频联合建模的团队,终于有了一个能同时优化模态内质量和跨模态对齐的 RL 框架,值得关注其方法论对自家任务的迁移潜力。
5月12日
19:11
19:11官方账号arXiv cs.LG@Wei Chow, Linfeng Li, Xian Sun, Lingdong Kong, Zefeng Li, Qi Xu, Hang Song, Tian Ye, Xian Wang, Jinbin Bai, Shilin Xu, Xiangtai Li, Junting Pan, Shaoteng Liu, Ran Zhou, Tianshu Yang, Songhua Liu
最近,研究者提出了一种基于掩码生成Transformer(MGT)的图像编辑新方法EditMGT,这是首个MGT编辑框架。与主流的扩散模型不同,MGT的局部化预测机制能天然将修改限制在目标区域,避免编辑结果扩散到其他部分。该方法通过多层注意力合并和区域保持采样实现精准编辑,并构建了包含200万高分辨率样本的数据集CrispEdit-2M。在多个基准测试中,EditMGT在仅96亿参数下实现了领先的图像相似度,编辑速度快了6倍。这表明MGT是扩散模型编辑的有力替代方案。
推荐理由:这项工作为图像编辑提供了一个全新思路,其局部化编辑特性和显著速度优势可能推动实用编辑工具的开发,值得关注。
19:10
19:10官方账号arXiv cs.AI@Keya Hu, Linlu Qiu, Yiyang Lu, Hanhong Zhao, Tianhong Li, Yoon Kim, Jacob Andreas, Kaiming He
研究者提出ELF(Embedded Language Flows)模型,将连续流匹配应用于语言建模。与现有主要在离散词元上操作的扩散语言模型不同,ELF在连续嵌入空间中运行,仅在最后一步通过共享权重网络映射为离散词元。该方法可简单适配图像扩散领域的成熟技术(如无分类器引导)。实验显示,ELF在生成质量和采样步数上均显著优于当前领先的离散和连续扩散语言模型,为高效连续语言模型提供了新方向。
推荐理由:ELF展示了连续扩散模型在语言建模中的有效性,简化了技术迁移路径,可能降低语言生成模型的设计复杂度。其较少的采样步数有利于实际应用效率,值得关注。
5月11日