8月20日
10:15
10:15官方账号arXiv cs.AI@Dongbin Kim, Seungyun Lee, Geonwoo Shin, Jaewook Lee
提出名为MDTIM的模型,采用掩码扩散技术解决时间序列插值问题;该模型对连续时间序列数据进行离散化处理后开展插值,与直接预测噪声的方式存在差异;在多个公开基准数据集上测试后,MDTIM的表现显著优于当前最先进的算法。
推荐理由:你说的那个MDTI模型,用掩码扩散来做时间序列插值,效果比之前的方法都强,感兴趣的话可以去了解下
10:12
10:12官方账号arXiv cs.LG@Yuga Iguchi, Paul Fearnhead
研究针对高维聚类数据的多模态分布,运用贝叶斯分类方法探究扩散模型的内在维度适应性;当信号噪声比达Θ(log(KD)/D)时,模型可精准识别数据所属簇;该研究证明扩散模型的KL误差与最大内在维度呈线性关系。
推荐理由:老张他们团队发的新研究,用贝叶斯分类看扩散模型适应高维数据,比之前方法效果更好了。
8月19日
11:45
11:45官方账号arXiv cs.AI@Xingjian Wang, Zhao Wang, Taihang Hu, Jun Zheng, Qing Jin, Qinye Zhou, Zhengtao Wu, Yongchao Du, Zuan Gao, Chao Lin, Yefeng Shen, Xiaoli Xu, Zhengze Xu, Hao Yan, Yuhang Yu, Mingzhou Zhang, Mengting Chen
精选
研究人员提出能力驱动的数据基础设施,构建了440M图像的T2I语料库和120M编辑对。该框架包含三个专门数据引擎,为文本-图像接地、图像间转换和图像-知识关联提供监督。基于此,团队训练了3B和6B两种规模的多模态扩散模型,在CPI-Bench评估中展现广泛视觉覆盖和多功能渲染能力。
推荐理由:这篇论文提出了一种新数据设计方法,训练出能同时处理多种图像生成任务的大模型,比传统方法更高效。
11:41
11:41官方账号arXiv cs.LG@Travis Zhang, Christian Belardi, Justin Lovelace, Jin Peng Zhou, Saebyeol Shin, Carla P. Gomes, Kilian Q. Weinberger
扩散模型采样通常需要多次神经网络前向传播,计算成本高昂。研究提出OYS方法,将时间步选择视为黑盒优化问题,直接使用贝叶斯优化目标指标。该方法在文本生成和图像修复任务上均优于默认采样方案,5步OYS采样可保留50步采样的89%-94%质量,同时降低10倍推理成本。
推荐理由:OYS方法用贝叶斯优化调整扩散模型采样,5步就能达到50步的质量,速度提升10倍,还不需额外训练。
8月18日
8月17日
10:16
10:16官方账号arXiv cs.LG@Xiaohong Chen, Yuling Jiao, Lican Kang, Jerry Zhijian Yang, Chen Zhong
论文提出用条件扩散模型估计奖励函数和转移核,以构建离线强化学习中的最优Bellman算子。理论给出该算子在总变差距离下的非渐近收敛速率,以及Q*估计的L2收敛率O(n^{-β/(d_x+d_a+2β)})。该分析不依赖完整性假设,状态维度d_x、动作维度d_a和Hölder平滑度β决定了收敛速度。
推荐理由:这篇用扩散模型估计奖励和转移核,再学Q*,收敛率给得很细,还绕开了RL里常见的完整性假设。
8月14日
8月10日
10:48
10:48官方账号arXiv cs.LG@Zhuotao Jin, Xiaoyun Wang, Nicholas Brawand, Roman Zubatyuk, Atul Thakur, Eric Qu, Boris Kozinsky, Justin Smith
DynaCrys是一种晶体生成模型,通过耦合符号扩散过程让空间群与Wyckoff占据和元素共同演化。其空间群转移遵循晶体学子群关系,并借助预训练对称性码本提供共享的Wyckoff词汇表示。在两个独立松弛评估引擎的大规模评测中,DynaCrys在稳定、独特和新颖晶体的对称性感知发现上达到最佳性能。它还支持快速采样,生成结构具有低松弛诱导位移。
推荐理由:DynaCrys把空间群和元素组成一起做扩散,两个评测引擎下都是最好成绩,生成还快,搞材料的人可以看看。
8月9日
18:25
18:25官方账号Decoder@Jonathan Kemper
Google DeepMind将Gemma 4改造成扩散模型DiffusionGemma,训练成本不到原始预算的10%。该模型一次并行生成256个token,推理速度约每秒1500个token。在基准测试中,DiffusionGemma的质量仍落后于原始自回归模型,尤其在推理任务上差距明显。
事件专题

推荐理由:Google DeepMind把Gemma 4改装成扩散模型DiffusionGemma,训练便宜十倍,生成快,但推理质量比原版差。适合想低成本做扩散模型的人看看。
8月6日
09:23
09:23官方账号arXiv cs.LG@Zehua Chen, Junyou Wang, Yuxuan Jiang, Zhenying Fang, Yusheng Dai, Jianfei Chen, Ziwei Liu, Jun Zhu
TD-V2A是一种基于扩散模型的视频到音频生成方法,利用时间差异作为区分视频与图像的关键表示。研究对比了帧级和特征级的时间差异,发现特征级更有效。该方法引入分层持续学习策略和退火时间差异引导,在基准数据集上取得优于对比音视频预训练的效果。
推荐理由:这篇论文提出用时间差异做视频生成音频,不用额外网络,效果还超过了对比预训练方法,值得做V2A的人看看。
8月5日
8月4日
09:36
09:36官方账号arXiv cs.AI@Zhihao Zhu, Hanlin Shang, Mingwang Xu, Feipeng Cai, Zhuolin He, Yaoyi Li, Jianhua Han, Hang Xu, Siyu Zhu
WAM-Diff2是一种多任务离散扩散VLA框架,通过三阶段分层蒸馏将预训练自回归模型转化为并行扩散模型。该方法解决了自回归解码的高延迟和暴露偏差问题,同时保留多任务视觉-语言推理能力。在驾驶理解、感知和规划基准上,WAM-Diff2与自回归基线性能持平。推理加速达2.8倍,结合FlashInfer和CUDA Graphs系统优化后最高可达15.1倍。
推荐理由:它把慢吞吞的自回归VLA模型变成并行扩散模型,性能不掉,推理快2.8倍,还能跑自动驾驶多任务。
06:27
06:27官方账号Latent Space (swyx)博客/媒体
76°
Baseten刚完成130亿美元F轮融资,成为推理工程领域的头部公司。本文由Philip Kiely和Ali Taha撰写,是一份推理工程大师课。内容聚焦自回归推理与扩散推理两大方向。适合从事AI模型部署的工程师阅读。
推荐理由:Baseten刚融了130亿美元,这篇大师课把自回归和扩散的推理工程讲透了,搞部署的可以看。
7月29日
7月28日
7月27日
10:57
10:57官方账号arXiv cs.LG@Ahmed M. Abuzuraiq, Philippe Pasquier
论文提出一种面向创意实践的可解释AI方法,让艺术家能检查、修改和调试扩散模型内部结构。作者在ComfyUI的节点工作流中集成了交互式层选择与干预控件,实现模型弯曲。通过对Stable Diffusion 1.5进行定性与定量分析,发现操纵不同组件(如UNet层)会产生相对一致的视觉效应。该方法帮助艺术家建立层级的直觉,理解模型各部分如何影响生成图像。
推荐理由:这篇论文告诉你,艺术家也能像玩材料一样玩扩散模型内部。他们在ComfyUI做了交互工具,能直接操纵Stable Diffusion的层,看到具体变化。不是理论说教,是真能动手调的。
7月24日
09:27
09:27官方账号arXiv cs.AI@Michael Romei de Socio, Gian Luca Pozzato, Alessio Merlo
该研究提出一种条件扩散模型,从部分观测生成未来图状态轨迹,并叠加符号约束层(硬过滤、软加权、投影修复)提升结构可行性。在紧凑图场景下,模型无效概率质量为0.002996;在中等复杂度依赖图场景下升至0.155929。硬过滤剔除所有无效轨迹,保留84.4%样本;软加权保持有效样本量但增益有限。分析表明依赖约束是几乎全部不可接纳性的来源。
推荐理由:这篇论文用具体数字告诉你,统计上合理的轨迹未必结构可行,扩散模型加符号约束能解决。看中型图场景下0.156的无效概率怎么被硬过滤砍掉。
7月23日
16:38
16:38官方一手Hugging Face: Blog博客/媒体
精选
Hugging Face 宣布将 Nunchaku 推理引擎集成到 Diffusers 库,支持 4-bit 量化扩散模型。开发者可以直接用 Diffusers API 加载 Nunchaku 格式的模型。该方案能将模型显存占用降低约 75%,同时保持生成质量。目前主要适配 Stable Diffusion 系列模型。
推荐理由:Hugging Face 把 Nunchaku 的 4-bit 量化推理直接塞进 Diffusers 了,以后用 SD 省一半显存,笔记本也能跑。
7月22日
00:59
00:59官方账号MIT CSAIL@MIT_CSAIL
精选78°
MIT研究人员提出一种新算法,能在指数级更少的采样步骤内达到与标准扩散模型相同的精度。该算法可大幅提升图像生成等扩散AI系统的效率。相关论文在ICML 2023荣获杰出论文奖(Outstanding Paper)。

推荐理由:MIT搞了个新算法,采样扩散模型快了很多,还拿了ICML最佳论文奖,做图像生成的朋友可以看看。
7月21日
09:34
09:34官方账号arXiv cs.LG@Evangelia Rafaela Frastali, Achyut Paudel, Maryam Golbazi, Frank Liu
Apeliotes框架结合全球再分析数据、预训练天气基础模型和区域扩散模型,生成公里级多变量大气场。在垂直风廓线预测上误差低于3%,10米风速相关性达0.91,2米温度相关性达0.99,NRMSE分别为0.42和0.17。该方法比传统动力降尺度计算成本大幅降低,可扩展至不同区域和变量。
推荐理由:这个框架用扩散模型做公里级天气预测,垂直风误差不到3%,比传统方法快很多,做精细化气象预报的朋友可以看看。
05:32
05:32OpenRouter@OpenRouterAI
OpenRouter 发布 Krea 2 Medium,定位为快速、低成本的通用图像生成起点。该模型在插画、动漫、绘画和表现主义风格上生成稳定一致。相比 Krea 2 完整版,Medium 版推理速度提升约 40%,API 定价降低 60%,适合批量创作和实验。
推荐理由:OpenRouter 出了个 Krea 2 Medium,速度快一半、价格打六折,画插画和动漫风格很稳,适合日常批量出图。