11:26官方账号arXiv cs.LG@Daniil Dmitriev, Zhihan Huang, Yuting Wei精选离散扩散模型提供了一种并行更新的替代方案,但其采样效率取决于前向过程和采样器的选择。本文提出了一种基于留一法去噪器的第一阶采样器,适用于均匀和重遮蔽过程,其坐标更新可并行进行。通过建立自适应采样保证,证明了在满足误差要求的情况下,所需的离散化步骤数量与目标分布的内禀依赖结构相关,而非环境维度。实验验证了这一理论预测的行为。论文离散扩散模型采样器去噪器推荐理由:这篇论文提出了一个新的采样器,提高了离散扩散模型的采样效率,对于想要了解最新采样技术的人来说是个好资源。原文稍后读已读值得跟进有用关注 离散扩散模型
11:33官方账号arXiv cs.AI@Harsha Vardhan Khurdula, Abhinav Kumar Singh, Yoeven D Khemlani, Vineet Agarwal本文提出用离散扩散语言模型DiffusionGemma(26B MoE)替代自回归解码器进行语音识别。方法冻结Whisper编码器提取声学特征,通过轻量投影器和低秩适配器将音频映射到模型空间,仅训练约42M参数(占0.16%)。研究发现自然训练目标梯度无法有效传递,引入连接主义时序分类(CTC)损失后成功训练。在LibriSpeech test-clean上达到6.6%词错误率,并行解码仅需8步且与语速无关,单适配器训练六种语言(评估了英语、印地语和普通话)。论文DiffusionGemmaWhisperLibriSpeech推荐理由:这个研究用DiffusionGemma做语音识别,并行解码8步就达到6.6%错误率,只训练了0.16%的参数,挺高效的。原文稍后读已读值得跟进有用关注 DiffusionGemma
11:58官方账号arXiv cs.LG@Haozhe Huang, Yudong Xu, Abhijoy Mandal, Alán Aspuru-Guzik离散扩散模型通过组合多个预训练专家实现复杂推理生成,但现有方法基于全样本加权,忽略了专家在空间或功能上的特化。本文提出FactorDiff,将生成样本分解为更小的因子,并在采样过程中动态路由每个因子到最相关专家。FactorDiff在ARC-AGI基准上验证了空间/像素级组合,其简单因子级路由在需要逻辑一致性和空间解耦的任务上持续优于复杂的全局标量加权方案。论文FactorDiffARC-AGI离散扩散模型推荐理由:这篇论文把专家组合从全局加权改成了因子级路由,在ARC-AGI上效果更好,适合研究离散扩散或组合生成的人看。原文稍后读已读值得跟进有用关注 FactorDiff
11:37官方账号arXiv cs.AI@Rodrigo Casado Noguerales, Bernhard Schölkopf, Thomas Hofmann, Aran Raoufi论文严格推导了连续时间马尔可夫链(CTMC)的ELBO,证明负ELBO恰好等于数据熵加上从Oracle逆过程到学习过程的路径KL散度。Oracle Distance定理指出,唯一最优解是给定当前噪声状态下真实逆跳转率的条件期望,而不可约成本是前向过程Z_t破坏关于干净数据Z_0信息的速率-d/dt I(Z_0; Z_t)。对于token-factorizing噪声,优化器有去噪器、桥接预测器和分数三种精确坐标,且存在封闭转换公式。该框架统一解释了MDM、UDM、SEDD和GIDD等方法的损失函数含义,并证明了去噪器参数化会在初始化时使均匀扩散ELBO发散,而桥接预测器保持有限。所有恒等式在精确可解模型上得到数值验证。论文离散扩散模型Oracle Distance定理CTMC ELBO推荐理由:这篇论文把离散扩散模型的理论基础讲透了,用Oracle Distance定理统一了多种损失函数,还揭示了去噪器和桥接预测器在初始化时的差异。想搞懂扩散模型原理的人别错过。原文稍后读已读值得跟进有用关注 离散扩散模型
10:49官方账号arXiv cs.LG@Yuchen Liang, Ness Shroff, Yingbin Liang精选离散扩散模型在文本和符号领域表现优异,但均匀率模型生成样本时通常需要大量步骤。现有加速方法要么需要额外训练,要么混合速度慢。本文提出Gibbs加速离散扩散(GADD),利用具体分数函数结构直接构建Gibbs后验似然,无需额外训练。GADD实现了O(polylog(ε^{-1}))的采样复杂度,是均匀率离散扩散模型的首个此类理论保证。实验表明,GADD在合成数据、零样本文本生成和条件音乐生成中,显著提升了样本质量和计算效率,优于标准基线方法。论文离散扩散模型Gibbs校正器采样加速推荐理由:离散扩散模型加速一直是个难题,GADD用Gibbs校正器实现了理论最优采样复杂度,做生成模型的研究者可以直接参考其方法。原文稍后读已读值得跟进有用关注 离散扩散模型
10:58官方账号arXiv cs.LG@Grigory Bartosh, Teodora Pandeva, Sushrut Karmalkar, Javier Zazo精选离散扩散模型在多个领域表现优异,但传统方法使用固定马尔可夫加噪链,导致生成过程需要大量采样步骤,计算成本高。本文提出 Forward-Learned Discrete Diffusion (FLDD),引入可学习的非马尔可夫加噪过程,使生成过程在保持因子化分布的同时,能更高效地匹配目标分布。通过端到端训练所有参数,FLDD 在相同采样步数下生成质量显著优于传统离散扩散模型。实验表明,该方法在图像、文本等基准上均能实现少步高质量生成,有望加速离散扩散模型的实际应用。论文离散扩散模型少步生成可学习加噪推荐理由:离散扩散模型终于有了加速方案——FLDD 用可学习加噪替代固定链,做生成模型的研究者可以直接在少步采样场景下替换传统方法,效果提升明显。原文稍后读已读值得跟进有用关注 离散扩散模型