11:03官方账号arXiv cs.AI@Sandy Abdo, Bill Kapralos, Priyamvada Tripathi, KC Collins, Adam Dubrowski这篇综述从Google Scholar、IEEE Xplore和ACM数字图书馆筛选了30篇同行评审文章,系统梳理了文本、视觉、音频和多模态输入对生成音效质量的影响。过去五年中,多个生成模型在语义对齐和时间连贯性上达到SOTA水平。但复杂多事件场景的时序同步仍是难点,客观指标与人类感知存在差距,可控性和生成多样性之间也有权衡。论文音效生成多模态生成模型推荐理由:想了解AI怎么根据文字或画面生成音效?这篇综述把近五年的模型都梳理了一遍,还点出了哪些任务还没做好,适合做声音设计的人参考。原文稍后读已读值得跟进有用关注 音效生成
12:49官方账号arXiv cs.AI@Zeshen Zheng, Yujia He, Qianmian Lin, Xiangyue Huang, Wenqing Chen这篇论文关注开放生成任务中的公平性评估,指出当模型生成“美国CEO”时,缺乏明确的人口统计目标分布。作者将目标构建拆解为评估对象、先验可采纳性、分配和操作化四个承诺,并在地理成员解释下允许地理先验。在AP-Bench基准上,地理派生目标与生成结果存在0.508至0.606的分布差异;改用等类别对照后,模型特定的JSD2变化范围达0.279至0.355。论文表明目标构建本身是公平性评估的组成部分,而非评估前的附属步骤。论文AP-Bench公平性生成模型推荐理由:如果你是搞生成模型评测的,这篇论文指出了公平性评估里常被忽略的问题:该拿什么目标分布去比。它给了个框架,还附了AP-Bench的具体数值。原文稍后读已读值得跟进有用关注 AP-Bench
09:45官方账号arXiv cs.LG@Kevin Lee, Benjamin Letham, Zhiyuan Jerry Lin, Elodie Samson, Eric Onofrey, Poppy Zhang, Shawndra Hill, Eytan Bakshy该研究提出一种离线到在线的广告创意优化流程,利用生成模型产出候选创意,并通过基于历史A/B测试数据训练的预测模型在推理时进行排序筛选。最终测试集在在线自适应实验(50臂)中验证,最佳创意比人类作者创意提升45.1%互动率,另两个实验分别提升46.7%和36.2%。尽管预测模型无法直接选出最优创意,但能有效引导生成模型产出强候选,再通过自适应实验高效评估。论文生成模型自适应测试A/B测试推荐理由:这篇论文教你用历史A/B数据+生成模型筛选创意,50臂实验最高提升45%,比人类写的强很多。原文稍后读已读值得跟进有用关注 生成模型
12:11官方账号arXiv cs.LG@Chirag Vashist, Ke LiROMS-IMLE 提出了一种极简的单步生成模型,仅使用隐式极大似然估计(IMLE)作为训练目标,并采用中等规模卷积网络,摒弃了迭代去噪和Transformer。在ImageNet 256分辨率上,该模型以单步生成达到FID 2.56,同时保持较好的精确率和召回率。实验表明,多步扩散并非高性能生成的必要条件,简洁设计也能实现竞争性结果。论文ROMS-IMLE生成模型单步生成推荐理由:这篇论文打破常规:不用多步扩散,只用单步卷积网络就在ImageNet上跑出FID 2.56,思路极简但效果惊艳,适合想了解生成模型新方向的你。原文稍后读已读值得跟进有用关注 ROMS-IMLE
09:56官方账号arXiv cs.LG@Midori Kato, Kevin A. Urquía-Calderón, Inar Timiryasov, Oleg RuchayskiyShellFlow是一个基于Transformer的生成模型,在5个数量级的不变质量范围(亚GeV到TeV)上学会了标准模型结构。它使用黎曼条件流匹配,在每个粒子的壳流形上生成,训练数据来自ATLAS Open Data的约10^9个真实pp对撞事件。模型仅用壳条件和不变质量公式作为物理先验,即学习到了双轻子共振(J/ψ、Υ、Z)在PDG位置、轻子Weinberg角、W和顶夸克质量,以及粒子间相关性。论文ShellFlowATLASLHC推荐理由:这篇论文展示了生成模型能从原始对撞数据中自动学习标准模型的结构,不需要模拟样本,连共振峰和质量都能自己学到。原文稍后读已读值得跟进有用关注 ShellFlow
09:30官方账号arXiv cs.LG@Susie Lu, Haonan Chen, Weirui Ye, Yilun DuDriftWorld 是一种动作条件的世界模型,通过训练中学习动作条件漂移,在单个前向传播中生成未来帧,速度达 30+ fps。相比扩散模型基线,平均推理速度提升 17 倍。在 Bridge-V2、RT-1、Language Table、Push-T、Robomimic 等机器人操控基准上,DriftWorld 以更少推理时间实现 SOTA 决策性能。它还可作为离线模拟器,用于排序真实机器人策略,滚动得分与真实结果相关性高达 0.99。AI模型DriftWorld世界模型机器人推荐理由:DriftWorld 能让机器人快速想象动作结果,比扩散模型快 17 倍,还能离线评估策略,性能强又省时。原文稍后读已读值得跟进有用关注 DriftWorld
09:21官方账号arXiv cs.LG@Saptarshi Roy, Debepsita Mukherjee, Pratik Patil该论文研究了整流流(Rectified Flow)的最优自蒸馏问题,其中学生模型在真实RF速度和教师速度的混合数据上训练,理论证明可提升教师模型。对于带有岭正则化的线性RF,作者推导了精确的仿射路径恒等式,并给出了最优混合系数的闭式解,正混合修正欠正则化教师,负混合修正过正则化教师。同时提出了一次广义交叉验证(GCV)方法,避免网格搜索和重复重拟合。实验在高斯模型、高斯混合和图像数据上验证,该方法在速度风险、模态恢复和有限步生成上均优于教师和纯蒸馏。论文Rectified FlowSelf-DistillationLinear Probing推荐理由:这篇论文用严格理论证明和实验验证了整流流中自蒸馏的改进方法,想了解生成模型自训练优化的可以看看。原文稍后读已读值得跟进有用关注 Rectified Flow
11:10官方账号arXiv cs.LG@Xiaoyu Li, Zheng Gao, Xiaoyan Feng, Jiaojiao Jiang, Yulei Sui, Jiankun Hu该论文从信息论角度研究生成模型水印的取证能力,包括归属用户、提取载荷和定位编辑幸存部分。定义信息轮廓ν(t)=I(S;X_t|X<t)并证明检测由分布距离决定,归属和提取由信息总量决定。主要定理给出统计无失真方案下归属N个用户需Θ(log N/h)个token(h为熵率),提取ℓ位载荷需Θ(ℓ/h)。在GPT-2、Pythia-410M、Qwen2.5上的实验验证了理论常数。论文水印信息论生成模型推荐理由:这篇论文用信息论精确测量了水印取样的代价:归属N个用户需要多少个token,提取载荷需要多少,并在GPT-2等模型上验证了理论预测。原文稍后读已读值得跟进有用关注 水印
10:49官方账号arXiv cs.AI@Eli Bar-Yosef, Amir Averbuch, Eli Turkel该研究提出Singularity Space框架,将信号表示为复数平面上的奇点配置(pole-residue)。框架具备三项关键性质:可解释性(奇点对应物理参数)、结构稳定性(抑制Gibbs伪影)、无分辨率重建(任意网格无需重训)。在1D Burgers激波测试中,32个预测奇点替代1024点网格(8倍压缩),零样本子分辨率推广下重建误差比网格基线降低4.2倍,物理参数恢复精度达10^-4绝对误差。论文Singularity Space扩散模型信号表示推荐理由:想用更少的点表示信号?这篇用复数奇点,32个点顶1024个网格,重建更准还能恢复物理参数,值得看看。原文稍后读已读值得跟进有用关注 Singularity Space
09:16官方账号arXiv cs.LG@Shuning Zhao, Patrick Wong, Leran Zhang, Xiaolin Hu生成模型在数据稀缺下的决策模拟中越来越常用,但风险敏感应用依赖罕见尾部场景。标准生成目标优化整体分布保真度,低概率尾部易受局部优化噪声影响。论文提出Diachronic Sample Integration (DSI),一种测试时推理框架,集成来自随机训练轨迹不同检查点的生成样本。DSI通过有限预算偏差-方差理论形式化,并在多变量合成过程和高频交易数据上,相比单检查点基线显著降低尾部估计误差,优于标准扩散和最先进尾部感知基线。论文DSI生成模型尾部风险估计推荐理由:这篇论文的DSI方法用多检查点集成来稳定尾部风险估计,实验效果比单检查点好不少,搞金融风控的值得一看。原文稍后读已读值得跟进有用关注 DSI
11:09官方账号arXiv cs.LG@Chandni Nagda, Mayank Shrivastavam Gudrun Thorkelsdottir, Gan Zhang, Morteza Mardani, Arindam Banerjee论文提出Flow Proposal Particle Filters(FPPF),通过生成模型学习最优提议分布进行粒子传播。FPPF能降低权重方差、延缓退化,并保留贝叶斯更新步骤。通过局部化策略扩展到高维问题。在多个非线性、非高斯、高维动力系统实验中,FPPF优于统计基线和其它生成方法。论文Flow Proposal Particle Filters粒子滤波数据同化推荐理由:这篇论文提出了一种叫FPPF的新粒子滤波方法,用生成模型做提议分布,解决了高维和非线性场景的退化问题,实验结果很扎实。原文稍后读已读值得跟进有用关注 Flow Proposal Particle Filters
15:16官方账号arXiv cs.LG@Sivaraman Balakrishnan这篇论文将有效传输映射估计问题形式化为一个严格的最小最大框架。推导出在标准稳定性假设下,估计任意有效传输映射的样本复杂度下界与估计最优传输(OT)映射相同。当稳定性假设不成立时,存在替代映射可以比OT映射更精确地学习。这些结果揭示了扩散模型和流匹配等生成方法的统计极限。论文扩散模型流匹配最优传输推荐理由:这篇论文严格证明了为什么有些生成模型不用最优传输也能行,给出了统计极限的硬理论,做生成模型理论的人必看。原文稍后读已读值得跟进有用关注 扩散模型
10:05官方账号arXiv cs.LG@Chen Wang, Peiran Yun, Pan Xie, Ke Deng现有扩散模型和连续流生成模型的确定性采样可视为求解学习到的ODE动力学,但准确离散化通常需要多步。论文指出轨迹匹配范式存在理论局限:两个学生模型可达到相同轨迹匹配损失却诱导不同端点边际分布,影响生成质量。为克服这一局限,提出边际对齐正则化器,通过追踪学生模型ODE沿线的对数密度变化并利用冻结教师模型评分来惩罚学生与教师边际分布的差异,无需辅助网络或对抗优化。该框架统一适用于原始再流和分段再流等再流族,并证明局部边际对齐通过 telescoping 总变差界控制最终时刻分布差异。在基准骨干网络上的实验验证了该方法在少步生成中的有效性。论文Reflow扩散模型蒸馏推荐理由:这篇论文发现了再流蒸馏的隐藏问题——轨迹匹配可能不够,还提出了一个简单有效的边际对齐正则化,不用额外网络就能提升少步生成质量,值得做扩散加速的人看看。原文稍后读已读值得跟进有用关注 Reflow
02:49官方一手Hugging Face: Blog(博客/媒体)精选Allen AI 发布 DiScoFormer,一种基于 Transformer 的架构,同时学习任意数据分布的密度函数和得分函数。传统方法如 NICE、MAF、ResFlow 需分别建模或使用归一化流,DiScoFormer 通过单一模型完成且无需显式归一化。在 2D 环形、高维高斯混合等多个基准分布上,DiScoFormer 的密度估计和得分误差均低于这些基线。该论文已被 NeurIPS 2024 接收,代码和预训练模型已在 GitHub 开源。AI模型DiScoFormerAllen AITransformer推荐理由:Allen AI 搞了个新模型 DiScoFormer,一个 Transformer 既能算密度又能算得分,比 NICE 这些老方法误差更低。想省事搞密度估计的可以看看。原文稍后读已读值得跟进有用关注 DiScoFormer
10:36官方账号arXiv cs.LG@Yu-Neng Wang, Sara Achour73°模拟硬件(如耦合振荡器)能耗比数字计算低两个数量级,但物理方程限制无法直接运行现代生成模型。该文提出Analog Interaction Systems(AIS)框架,利用时变分段参数和隐藏物理状态两种机制缩小表达差距,并采用Wasserstein GAN训练。在MNIST和Fashion-MNIST上,基于振荡器的AIS分别取得FID 27.6和80.8,比此前最优模拟硬件生成模型提升3-4倍。能量估算为每张生成图像23μJ,较数字基线降低约100倍。AI模型AIS模拟硬件生成模型推荐理由:模拟硬件跑生成模型能耗低两数量级,AIS框架在MNIST上FID仅27.6,比之前好3-4倍,适合低功耗场景。原文稍后读已读值得跟进有用关注 AIS
10:42官方账号arXiv cs.LG@Yuhui Yin, Vassilis M. Charitopoulos论文提出Generative Robust Optimisation (GRO)框架,用深度生成模型(如Wasserstein Adversarial Autoencoder)的解码器图像作为不确定性集,能表达非线性、非对称和多模态依赖。框架包含五个评估标准:重建保真度、分布匹配、潜在空间规整性、鲁棒相关性和计算可处理性。在六个不确定性分布和六种生成架构的生产规划问题以及多周期设施选址实验中,系统关注全部五个标准能同时提升不确定性集的表达力和优化可解性。论文Generative Robust Optimisation鲁棒优化生成模型推荐理由:这篇论文用生成模型替换传统固定形状的不确定性集,给出了五个可操作的评估标准,生产规划实验数据扎实,搞鲁棒优化或不确定性量化的值得看看。原文稍后读已读值得跟进有用关注 Generative Robust Optimisation
10:53官方账号arXiv cs.LG@Marco Skocaj, Lukas Eller, Mate Boban该论文从感知-失真权衡角度理论分析了分数匹配模型在无线信道估计中的适用条件。通过将下游无线任务(如容量最大化)建模为信道估计的泛函,量化了传统失真最小化方法的超额风险。数值实验表明,在高预测不确定性下,分数生成模型能实现接近贝叶斯最优的预编码,而低不确定性时判别性方法更优。该研究基于IEEE场景验证了超过5dB的信噪比增益。论文Score-Based ModelsChannel Estimation感知-失真权衡推荐理由:想看分数模型在无线通信里到底有什么用吗?这篇论文用感知-失真框架告诉你,信道估计时高不确定性用得分匹配,低不确定性用传统方法,有理论有实验。原文稍后读已读值得跟进有用关注 Score-Based Models
11:11官方账号arXiv cs.LG@Junming Zhang, Siyu Yi, Wei Ju, Zhonghui GuPepALD是一种自回归潜在扩散基础模型,用于从头生成大环肽。该模型使用结构化学嵌入表示HELM单体,在化学信息潜在空间中通过上下文条件扩散生成每个残基。它能在自回归生成过程中预测R基团感知的环闭合,并通过获胜者保护的扩散适应偏好优化与亲和力奖励对齐。实验表明PepALD在生成质量和奖励优化上优于代表性肽生成基线。AI模型PepALD大环肽扩散模型推荐理由:PepALD赋能大环肽设计原文稍后读已读值得跟进有用关注 PepALD
13:08官方账号arXiv cs.AI@Danqi Zhuang, Jisui Huang, Xiaoyue Xi, Andrew Kiggins, Xiaojie Wang, Ke Chen, Yue Wu标准扩散模型通常使用单一高斯分布作为终端参考分布,这难以捕捉数据在低维流形上的结构。PTL-Diffusion 提出一种新的前向噪声过程,其终端分布不再是单一不变分布,而是一族周期性的高斯分布,从而将相位结构直接嵌入前向动力学。该方法推导了封闭形式的前向边缘分布、周期高斯终端族和显式高斯反向后验,并引入不变平均正则化项来耦合相位条件反向动力学。在环面、圆柱点云和 Olivetti 人脸数据集上的实验表明,PTL-Diffusion 在流形级别的分布匹配上优于标准 DDPM,减少了相位条件误差、特征空间协方差误差和最近邻流形距离。这项工作为结构化终端参考分布提供了有前景的方向。论文扩散模型流形学习周期终端分布推荐理由:做生成模型的研究者会发现,PTL-Diffusion 用周期终端分布解决了流形结构丢失的痛点,在低维流形数据上效果明显,值得在点云或人脸生成任务上试试。原文稍后读已读值得跟进有用关注 扩散模型
11:02官方账号arXiv cs.LG@Chris R. Jung, Markus Dörr, Natalie Jüngling, Jennifer Niessner, Adam T. Müller, Nicolaj C. Stache计算流体动力学(CFD)虽能高保真模拟室内环境流场,但计算成本高,限制了快速探索。为解决此问题,生成式替代模型比确定性网络能更好建模分布,但迭代采样速度慢。本文首次将生成式漂移框架(Drifting Models)应用于流体力学,提出条件架构在VAE潜在空间中进行漂移,并使用标签感知掩码对齐生成样本与边界条件。该标签条件模型在精度和流一致性上匹配迭代扩散模型,但运行速度快两个数量级。此外,空间条件变体为泛化到未见几何体铺平了道路。条件漂移成为扩散模型的高效替代方案,解锁了推理速度关键的实时CFD替代模型。论文生成模型流体模拟CFD推荐理由:做流体模拟或室内环境优化的团队终于有了一个又快又准的替代方案——Drifting Models 比扩散模型快两个数量级,精度却不输,值得在实时 CFD 场景中直接试试。原文稍后读已读值得跟进有用关注 生成模型
11:59官方账号arXiv cs.AI@Qi Lan, Yining Tang, Yu Shen, Yi Zhou, Yuhao Wei, Jie Li, Guofa Li精选安全关键交通场景生成对评估自动驾驶系统在罕见但高风险交互下的表现至关重要。现有扩散方法虽在闭环生成中可控性强,但迭代去噪过程计算成本高,且长序列中易累积采样和引导误差,导致抖动、异常加速等不真实运动。RiskFlow 提出一种新框架,将未来轨迹生成建模为动作空间中的传输,通过单次前向传播学习平均速度场,将高斯动作序列转化为加速度和偏航率指令,并利用输出空间引导生成高风险交互,同时保持物理可行性。实验表明,RiskFlow 在多智能体和长时域设置下实现了对抗性与真实性的良好平衡,显著提升真实性并降低推理时间。论文自动驾驶安全关键场景生成RiskFlow推荐理由:自动驾驶安全测试场景生成一直面临计算慢、动作不真实的问题,RiskFlow 用单次前向传播替代迭代去噪,做仿真评估的团队可以直接用,效果比扩散方法更高效更保真。原文稍后读已读值得跟进有用关注 自动驾驶
12:01官方账号arXiv cs.LG@Anand Babu, Rogério Almeida Gouvêa, Gian-Marco Rignanese本文综述了生成模型、多模态学习和闭环工作流在逆向材料设计中的最新进展。逆向材料设计从正向预测转向在物理约束下直接提出满足目标的候选材料。文章比较了变分自编码器、归一化流、自回归模型和扩散模型等主流生成模型,并讨论了如何通过表示选择、训练目标、采样时引导和后生成筛选来施加可行性约束。多模态学习融合晶体结构、热力学、电子信息、显微镜、光谱、加工背景和科学文本,构建更通用的化学空间表示。文章还分析了逆向设计策略,包括条件生成与潜在优化、贝叶斯优化、强化学习和主动学习,并指出了常见的失败模式如替代利用、多样性崩溃、分布偏移和稳定性-可合成性差距。论文生成模型多模态学习逆向材料设计推荐理由:这篇综述系统梳理了逆向材料设计中的生成模型与多模态学习,做材料科学或AI驱动的发现研究的团队可以快速了解当前方法、失败模式和评估实践,节省大量文献调研时间。原文稍后读已读值得跟进有用关注 生成模型
00:33AK@_akhaliq该研究提出了一种名为对比分布匹配(Contrastive Distribution Matching)的新方法,用于改进离散扩散模型中的摊销序贯蒙特卡洛(Amortized Sequential Monte Carlo)采样。该方法通过对比学习优化分布匹配,显著提升了离散扩散模型的采样效率和质量。实验表明,该方法在多个基准任务上优于现有技术,为离散扩散模型的实用化提供了新思路。论文离散扩散对比学习序贯蒙特卡洛推荐理由:离散扩散模型在文本、图结构等离散数据生成中至关重要,但采样效率一直是瓶颈。这篇论文提出的对比分布匹配方法直接解决了这个问题,做生成模型研究的开发者值得关注。原文稍后读已读值得跟进有用关注 离散扩散
11:05官方账号arXiv cs.AI@Stanislav R. Kirpichenko, Andrei V. Konstantinov, Lev V. Utkin精选生存分析旨在从含删失数据中估计事件时间分布,但现有方法常对风险函数施加结构假设或离散化时间轴,限制了灵活性并引入近似误差。本文提出生存扩散概率模型(SDPM),一种基于去噪扩散模型的连续时间生存分析方法。SDPM 直接建模生存结果的条件分布,利用条件独立删失假设,通过生成样本结合 Kaplan-Meier 估计器得到生存函数,无需参数假设或时间离散化。在十个真实数据集上,SDPM 在 C-index、时间依赖 AUC 和 Brier 评分上达到与树模型、提升模型和神经网络模型相当的预测性能。合成数据实验表明,SDPM 能更准确地恢复底层连续生存分布的形状,消融研究验证了目标空间变换对事件率校准和预测区分度的提升。论文生存分析扩散模型连续时间推荐理由:生存分析是医学、可靠性工程等领域的核心问题,SDPM 用扩散模型绕过了传统方法的参数假设和离散化限制,做生存预测的团队可以直接用公开代码复现,值得关注。原文稍后读已读值得跟进有用关注 生存分析
09:46官方账号arXiv cs.AI@John-Joseph Brady, Nikolas Nusken, Yunpeng Li精选深度状态空间模型(DSSM)在统计建模中广泛应用,但大规模训练一直困难。现有方法分为两类:自编码DSSM通过优化变分下界训练生成模型,而基于序贯蒙特卡洛(SMC)的方法可处理判别与生成任务,但因前向过程的顺序性在GPU上扩展性差。研究者提出并行变分蒙特卡洛(PVMC)方法,融合两类范式优势,在基准实验中达到或超越当前最优结果,且训练速度比最快的SMC方法快10倍。该方法可稳健训练DSSM用于判别和生成任务,解决了SMC方法在硬件上的扩展瓶颈。论文深度状态空间模型并行变分蒙特卡洛训练加速推荐理由:做时间序列建模或状态空间模型研究的团队,PVMC让训练速度提升10倍且不牺牲精度,值得直接尝试。原文稍后读已读值得跟进有用关注 深度状态空间模型
11:13官方账号arXiv cs.LG@Yuchen Wu, Kangjie Zhou, Weijie Su精选本文研究了在结构化交互学习环境中,生成模型因反复使用其他模型生成的合成数据而导致性能退化(模型崩溃)的条件。作者用有向图形式化模型间的交互模式,发现模型崩溃的发生关键取决于交互图的拓扑结构。他们推导出模型崩溃发生的充要条件,并为线性回归和一般M估计器建立了有限样本和渐近理论保证。这项研究填补了此前仅关注单模型自训练而忽略多模型交互场景的空白。论文模型崩溃交互学习生成模型推荐理由:做生成模型训练或数据增强的团队,这篇论文帮你搞清楚多模型交互时什么时候会踩坑——交互图拓扑是决定因素,值得仔细看看理论条件。原文稍后读已读值得跟进有用关注 模型崩溃
11:01官方账号arXiv cs.LG@Grigory Bartosh, David Ruhe, Emiel Hoogeboom, Jonathan Heek, Thomas Mensink, Tim Salimans精选Dual-Rate Diffusion 提出了一种新的扩散模型加速方法,通过交错执行一个稀疏更新的重上下文编码器和一个轻量去噪模型来降低推理成本。重编码器每几步提取一次高维特征,轻量模型则在每一步复用这些特征进行高效去噪。在 ImageNet 基准上,该方法在保持生成质量的同时将计算成本降低 2-4 倍。此外,该方法与蒸馏技术(如 Moment Matching Distillation)兼容,可进一步加速少步生成。论文扩散模型推理加速ImageNet推荐理由:扩散模型推理慢是落地痛点,Dual-Rate Diffusion 用轻量网络复用特征,做图像生成的团队可以直接拿来加速现有模型,效果不打折。原文稍后读已读值得跟进有用关注 扩散模型
10:58官方账号arXiv cs.LG@Grigory Bartosh, Teodora Pandeva, Sushrut Karmalkar, Javier Zazo精选离散扩散模型在多个领域表现优异,但传统方法使用固定马尔可夫加噪链,导致生成过程需要大量采样步骤,计算成本高。本文提出 Forward-Learned Discrete Diffusion (FLDD),引入可学习的非马尔可夫加噪过程,使生成过程在保持因子化分布的同时,能更高效地匹配目标分布。通过端到端训练所有参数,FLDD 在相同采样步数下生成质量显著优于传统离散扩散模型。实验表明,该方法在图像、文本等基准上均能实现少步高质量生成,有望加速离散扩散模型的实际应用。论文离散扩散模型少步生成可学习加噪推荐理由:离散扩散模型终于有了加速方案——FLDD 用可学习加噪替代固定链,做生成模型的研究者可以直接在少步采样场景下替换传统方法,效果提升明显。原文稍后读已读值得跟进有用关注 离散扩散模型
10:02官方账号arXiv cs.AI@Chenrui Ma, Xi Xiao, Lin Zhao, Tianyang Wang, Ferdinando Fioretto, Yanning Shen精选Drift Flow Matching (DFM) 提出了一种新框架,将高效的 Drift 模型(单步生成)与 Flow Matching(多步迭代生成)结合起来。DFM 保留了直接传输映射的效率,同时允许通过多步推理来优化生成质量,从而在计算成本与生成质量之间灵活权衡。实验表明,DFM 在多个任务和数据集上均有效,为生成模型提供了新的自适应采样范式。论文生成模型Flow MatchingDrift 模型推荐理由:做生成模型研究的开发者终于有了一个既能高效单步生成、又能按需多步精调的框架——DFM 解决了 Drift 模型缺乏推理扩展性的痛点,值得关注其在不同场景下的灵活应用。原文稍后读已读值得跟进有用关注 生成模型
10:38官方账号arXiv cs.LG@Hazhir Aliahmadi, Irina Babayan, Greg van Anders精选变分自编码器(VAE)普遍存在后验坍塌问题,即潜在变量被忽略。本文提出熵自编码器(EAE),仅以重构损失为显式目标,通过自由能最小化的编码器集成隐式生成潜在变量的先验。EAE 能学习非高斯、多模态的潜在分布,从而缓解后验坍塌,生成多样且与数据一致的样本。在反应扩散过程、MNIST 和 CelebA 数据集上,EAE 分别捕捉了低维动力学、隐式类别区分和面部层次结构。该框架为生成模型提供了一种新的训练范式。论文生成模型变分自编码器后验坍塌推荐理由:VAE 的后验坍塌是生成模型老难题,EAE 用隐式先验巧妙绕开,做生成模型或表示学习的开发者值得一看。原文稍后读已读值得跟进有用关注 生成模型
10:30官方账号arXiv cs.LG@Shuchan Wang精选研究人员提出了一种新的生成模型水印方法,将水印直接嵌入到Flow Matching模型的连续动态(速度场)中,而非模型权重或输出。该方法通过随机编码在训练时添加密钥相关的扰动,检测时从黑盒查询中恢复信息,且不改变生成分布。在MNIST和CIFAR-10上的实验表明,该方法能可靠恢复水印,保持生成质量,且无密钥时解码准确率仅为随机水平。论文水印Flow Matching生成模型推荐理由:这项研究解决了生成模型版权保护的核心难题——水印不可篡改且不影响生成质量,做AI安全或模型部署的团队值得关注,可以直接参考其黑盒检测方案。原文稍后读已读值得跟进有用关注 水印