8月5日
11:03
11:03官方账号arXiv cs.AI@Sandy Abdo, Bill Kapralos, Priyamvada Tripathi, KC Collins, Adam Dubrowski
这篇综述从Google Scholar、IEEE Xplore和ACM数字图书馆筛选了30篇同行评审文章,系统梳理了文本、视觉、音频和多模态输入对生成音效质量的影响。过去五年中,多个生成模型在语义对齐和时间连贯性上达到SOTA水平。但复杂多事件场景的时序同步仍是难点,客观指标与人类感知存在差距,可控性和生成多样性之间也有权衡。
推荐理由:想了解AI怎么根据文字或画面生成音效?这篇综述把近五年的模型都梳理了一遍,还点出了哪些任务还没做好,适合做声音设计的人参考。
7月22日
7月20日
7月17日
7月15日
11:10
11:10官方账号arXiv cs.LG@Xiaoyu Li, Zheng Gao, Xiaoyan Feng, Jiaojiao Jiang, Yulei Sui, Jiankun Hu
该论文从信息论角度研究生成模型水印的取证能力,包括归属用户、提取载荷和定位编辑幸存部分。定义信息轮廓ν(t)=I(S;X_t|X<t)并证明检测由分布距离决定,归属和提取由信息总量决定。主要定理给出统计无失真方案下归属N个用户需Θ(log N/h)个token(h为熵率),提取ℓ位载荷需Θ(ℓ/h)。在GPT-2、Pythia-410M、Qwen2.5上的实验验证了理论常数。
推荐理由:这篇论文用信息论精确测量了水印取样的代价:归属N个用户需要多少个token,提取载荷需要多少,并在GPT-2等模型上验证了理论预测。
7月14日
7月2日
11:09
11:09官方账号arXiv cs.LG@Chandni Nagda, Mayank Shrivastavam Gudrun Thorkelsdottir, Gan Zhang, Morteza Mardani, Arindam Banerjee
论文提出Flow Proposal Particle Filters(FPPF),通过生成模型学习最优提议分布进行粒子传播。FPPF能降低权重方差、延缓退化,并保留贝叶斯更新步骤。通过局部化策略扩展到高维问题。在多个非线性、非高斯、高维动力系统实验中,FPPF优于统计基线和其它生成方法。
推荐理由:这篇论文提出了一种叫FPPF的新粒子滤波方法,用生成模型做提议分布,解决了高维和非线性场景的退化问题,实验结果很扎实。
6月30日
6月16日
5月29日
5月19日
11:01
11:01官方账号arXiv cs.LG@Grigory Bartosh, David Ruhe, Emiel Hoogeboom, Jonathan Heek, Thomas Mensink, Tim Salimans
精选
Dual-Rate Diffusion 提出了一种新的扩散模型加速方法,通过交错执行一个稀疏更新的重上下文编码器和一个轻量去噪模型来降低推理成本。重编码器每几步提取一次高维特征,轻量模型则在每一步复用这些特征进行高效去噪。在 ImageNet 基准上,该方法在保持生成质量的同时将计算成本降低 2-4 倍。此外,该方法与蒸馏技术(如 Moment Matching Distillation)兼容,可进一步加速少步生成。
推荐理由:扩散模型推理慢是落地痛点,Dual-Rate Diffusion 用轻量网络复用特征,做图像生成的团队可以直接拿来加速现有模型,效果不打折。
10:02
10:02官方账号arXiv cs.AI@Chenrui Ma, Xi Xiao, Lin Zhao, Tianyang Wang, Ferdinando Fioretto, Yanning Shen
精选
Drift Flow Matching (DFM) 提出了一种新框架,将高效的 Drift 模型(单步生成)与 Flow Matching(多步迭代生成)结合起来。DFM 保留了直接传输映射的效率,同时允许通过多步推理来优化生成质量,从而在计算成本与生成质量之间灵活权衡。实验表明,DFM 在多个任务和数据集上均有效,为生成模型提供了新的自适应采样范式。
推荐理由:做生成模型研究的开发者终于有了一个既能高效单步生成、又能按需多步精调的框架——DFM 解决了 Drift 模型缺乏推理扩展性的痛点,值得关注其在不同场景下的灵活应用。
5月18日