7月10日
05:54
05:54官方账号NVIDIA AI@NVIDIAAI
精选
Flex-Forcing是NVIDIA研究团队发布的视频生成方法。当前主流方法有双向扩散(同时建模所有帧,结构稳但慢)和自回归(逐帧生成,快且支持长片段,但漂移)。Flex-Forcing训练单一模型在推理时可根据计算预算选择任一种方式或中间态。
事件专题

推荐理由:NVIDIA新出的Flex-Forcing,一个模型就能在双向扩散和自回归之间切换,想快想稳都行,挺省事的。
7月8日
10:17
10:17官方账号arXiv cs.AI@Yoav Baron, Sara Dorfman, Roni Paiss, Daniel Cohen-Or, Or Patashnik
本文研究VLM在扩散图像编辑管线中作为条件编码器时的定位能力下降问题。作者提出Analysis-by-Proxy框架,训练轻量级代理模型在VLM中间表示上执行辅助定位任务。实验发现,在单次前向传递约束下,定位信号未可靠传播到预设条件层配置,而是隐藏在随输入提示变化的中间表示中。该框架揭示了现有编辑管线条件提取策略的根本失败,为设计更合理的条件架构提供了方向。
推荐理由:这篇论文把VLM做图像编辑时定位不准的老问题挖到底了——原来不是模型不行,是提取信号的方式错了。他们用了个'代理分析'的巧招,把隐藏的定位信号给揪了出来,搞编辑管线的值得一看。
10:16
10:16官方账号arXiv cs.LG@Naveen George, Naoki Murata, Yuhta Takida, Konda Reddy Mopuri, Yuki Mitsufuji
TILDE 提出一种新的概念遗忘框架,将遗忘问题形式化为分布对齐任务。该方法通过能量倾斜条件分布,在抑制目标概念图像生成的同时保持提示的良性相对质量。实验在对象、艺术风格和角色等场景下,TILDE 实现强力遗忘,并在保留质量和分布保真度上超越现有基线。
推荐理由:这篇论文提出了 TILDE,通过分布对齐让概念遗忘模型既能精准擦除目标,又不会牺牲常规生成质量。
7月6日
19:51
7月2日
12:10
7月1日
11:35
11:35官方账号arXiv cs.LG@Nikolai Röhrich, Julian Gleißner, Ahmed H. A. Ibrahim, Silvan Mertes, Tobias Huber
该论文提出一种不确定性引导的合成上下文增强策略,利用基线分割器的预测熵识别不确定语义区域,仅对互补视觉上下文进行修补。在Cityscapes、UAVID和BDD100K数据集上,微调后mIoU分别提升1.2%、2.1%和1.8%,尤其在公交车、火车和汽车等稀有类别上增益最大。该方法无需外部模型,严格保持标签有效性,且计算损失时仅基于原始像素。
推荐理由:搞语义分割的可以试试这个,它只增强模型犯难的区域,在几个自动驾驶数据集上提点挺明显,尤其是稀有类别。
09:55
09:55官方账号arXiv cs.LG@Ole Winther, Paul Jeha, Sander Dieleman, Andriy Mnih, Manfred Opper, Andrea Dittadi
这篇论文从变分视角系统介绍了随机微分方程(SDE)在生成机器学习中的应用。它推导了证据下界(ELBO)并作为讨论扩散模型、得分匹配和流匹配的统一框架。论文使用一维密度建模问题比较了不同参数化的效果。
推荐理由:想搞懂扩散模型、得分匹配背后的数学原理?这篇论文从变分角度讲清楚了SDE和ELBO,适合想深入理论的朋友。
6月30日
6月25日
09:33
09:33官方账号arXiv cs.AI@Octavia-Andreea Ciora, Julian Welzel, Dennis Frauen, Maresa Schröder, Marie Brockschmidt, Harry Amad, Thomas Callender, Mihaela van der Schaar, Stefan Feuerriegel
OncoSynth是一种因果感知的生成式机器学习框架,采用扩散序列方法模拟协变量对治疗分配的影响以及治疗对生存的影响。在大规模肺癌(N=37,128)和乳腺癌(N=17,046)队列上评估,OncoSynth生成的合成患者队列能保留真实世界的患者、治疗和结局分布。与现有方法相比,OncoSynth将群体水平治疗效应估计误差降低最多66%,患者水平误差降低最多58%。该方法支持在数据共享受限场景下为精准肿瘤学提供可靠证据。
推荐理由:这篇论文推出了OncoSynth,能用合成数据准确估计肿瘤治疗效果,比现有方法误差降低一半以上,适合做医疗AI的朋友了解。
6月23日
10:38
10:38官方账号arXiv cs.LG@Pengfei Li, Mohammad Khalil
Fed-CausalDiff是一种联邦因果扩散框架,专门用于“do-simulation”和政策评估。它将潜在状态演化分解为全局因果评分函数和局部混淆评分函数,实现解耦同步(DSS),客户端只聚合共享因果机制而保留本地特定混淆。在四个数据集上的实验显示,Fed-CausalDiff在ATE和政策价值估计精度上优于传统方法,并在通信成本与推理保真度之间取得更好平衡。
推荐理由:这篇论文提出Fed-CausalDiff,让联邦学习不仅能拟合历史数据,还能做因果干预模拟。它在四个数据集上比常规方法更准,而且通信开销可控,适合分布式医疗或金融场景。
6月16日
6月12日
13:46
13:46官方账号arXiv cs.LG@Paul Seij, Christian A. Naesseth, Stephan Mandt, Metod Jazbec
扩散模型在3D分子生成中广泛应用,但缺乏对生成分子质量的可靠信号。研究者提出一种后处理方法,基于拉普拉斯近似对预训练分子扩散模型进行逐样本不确定性估计。该方法通过测量生成轨迹中噪声预测的变异性来评估不确定性,实验表明该分数与样本质量负相关。利用该分数过滤生成样本,可在测试时提升模型性能。
推荐理由:做分子生成或药物设计的团队,终于有了一个能判断生成分子质量好坏的信号,建议试试这个后处理方法,能直接提升模型输出质量。