01:03Y Combinator@ycombinator精选Y Combinator Paper Club 本周聚焦数据。随着模型在任务和语言上扩展,关于训练和评估的旧假设开始失效。专家们讨论了训练数据、基准测试和多语言预训练的挑战与前沿。Vincent Sunn 谈论了智能体基准测试的艺术与科学。Volokhuleshov 介绍了 Inception 扩散语言模型。Shayne Redford 讲解了 ATLAS 多语言模型的实用缩放定律。论文Y CombinatorPaper Club智能体推荐理由:Y Combinator Paper Club 请了三位专家,分别讲了智能体基准测试、扩散语言模型和实用缩放定律,都是数据相关的前沿话题。原文稍后读已读值得跟进有用关注 Y Combinator
10:15官方账号arXiv cs.AI@Dongbin Kim, Seungyun Lee, Geonwoo Shin, Jaewook Lee提出名为MDTIM的模型,采用掩码扩散技术解决时间序列插值问题;该模型对连续时间序列数据进行离散化处理后开展插值,与直接预测噪声的方式存在差异;在多个公开基准数据集上测试后,MDTIM的表现显著优于当前最先进的算法。AI模型MDTIM时间序列扩散模型推荐理由:你说的那个MDTI模型,用掩码扩散来做时间序列插值,效果比之前的方法都强,感兴趣的话可以去了解下原文稍后读已读值得跟进有用关注 MDTIM
10:12官方账号arXiv cs.LG@Yuga Iguchi, Paul Fearnhead研究针对高维聚类数据的多模态分布,运用贝叶斯分类方法探究扩散模型的内在维度适应性;当信号噪声比达Θ(log(KD)/D)时,模型可精准识别数据所属簇;该研究证明扩散模型的KL误差与最大内在维度呈线性关系。论文扩散模型贝叶斯分类高维数据推荐理由:老张他们团队发的新研究,用贝叶斯分类看扩散模型适应高维数据,比之前方法效果更好了。原文稍后读已读值得跟进有用关注 扩散模型
11:45官方账号arXiv cs.AI@Xingjian Wang, Zhao Wang, Taihang Hu, Jun Zheng, Qing Jin, Qinye Zhou, Zhengtao Wu, Yongchao Du, Zuan Gao, Chao Lin, Yefeng Shen, Xiaoli Xu, Zhengze Xu, Hao Yan, Yuhang Yu, Mingzhou Zhang, Mengting Chen精选研究人员提出能力驱动的数据基础设施,构建了440M图像的T2I语料库和120M编辑对。该框架包含三个专门数据引擎,为文本-图像接地、图像间转换和图像-知识关联提供监督。基于此,团队训练了3B和6B两种规模的多模态扩散模型,在CPI-Bench评估中展现广泛视觉覆盖和多功能渲染能力。论文图像生成扩散模型多模态推荐理由:这篇论文提出了一种新数据设计方法,训练出能同时处理多种图像生成任务的大模型,比传统方法更高效。原文稍后读已读值得跟进有用关注 图像生成
11:41官方账号arXiv cs.LG@Travis Zhang, Christian Belardi, Justin Lovelace, Jin Peng Zhou, Saebyeol Shin, Carla P. Gomes, Kilian Q. Weinberger扩散模型采样通常需要多次神经网络前向传播,计算成本高昂。研究提出OYS方法,将时间步选择视为黑盒优化问题,直接使用贝叶斯优化目标指标。该方法在文本生成和图像修复任务上均优于默认采样方案,5步OYS采样可保留50步采样的89%-94%质量,同时降低10倍推理成本。论文扩散模型贝叶斯优化OYS推荐理由:OYS方法用贝叶斯优化调整扩散模型采样,5步就能达到50步的质量,速度提升10倍,还不需额外训练。原文稍后读已读值得跟进有用关注 扩散模型
10:29官方一手arXiv: Google DeepMind@Sina Baghal判断推箱子谜题是否可解是 PSPACE-complete 问题(Culberson, 1997),解可能指数级长。研究者用基于 transformer 的离散扩散模型,仅训练瓷砖补齐任务,不访问求解器或可解性标签,生成谜题的可解率达 77.4%。剩余失败中 94.5% 只需移除一面墙即可变为可解。该模型基于 MD4 训练管线,使用 DeepMind 的 Boxoban 数据集,代码与生成指令已公开。论文Sokoban扩散模型Boxoban推荐理由:这篇论文用扩散模型搞出了能生成可解推箱子的办法,不用求解器,成功率77.4%,失败的大多拆一面墙就能救回来,而且开源可用。原文稍后读已读值得跟进有用关注 Sokoban
10:02官方账号arXiv cs.AI@Ali Boudaghi, Alireza Nemati, Hadi ZareFirstDiff 提出基于初始噪声预测的异常检测框架,只需一次去噪网络评估即可完成推理,无需走完整个反向扩散轨迹。它利用验证数据对正常行为下的预测扩散噪声进行统计建模,从而从单次评估中推断异常。FirstDiff 采用 Diffusion Transformer 作为去噪骨干,以建模复杂的时间与传感器间依赖。在五个公开基准数据集上,FirstDiff 达到最先进性能,同时将扩散推理从完整反向轨迹缩减为单次去噪评估。AI模型FirstDiff扩散模型异常检测推荐理由:不用跑完整扩散过程,第一次预测噪声就能判断异常,速度快还更准,时序异常检测可以看看这个方法。原文稍后读已读值得跟进有用关注 FirstDiff
03:13elvis@omarsar0omarsar0 在推文中说,LLM 编程模型在解锁通用能力上的表现超出预期。他认为扩散模型很快会有自己的高光时刻,但更期待 LLM 继续进步并超越。@trq212 的近期程序化生成艺术、视频编辑和 3D 游戏 demo 让他认为,LLM 编程模型在不少创意工作上比扩散模型更强。AI模型编程助手扩散模型视频生成推荐理由:推文聊了个反直觉观点:写代码的 LLM 在生成艺术、视频编辑、3D 游戏等创意任务上,可能比扩散模型更强。原文稍后读已读值得跟进有用关注 编程助手
10:17官方账号arXiv cs.LG@Yixian Xu, Yuanrui Zhang, Shengjie Luo, Liwei Wang, Di He精选现有扩散模型强化学习算法分为反向轨迹与前向匹配两类,分别依赖离散化似然比和带奖励标签的噪声版本。本文从正则化扩散RL目标出发,用重要性采样得到轨迹空间的策略梯度估计,其中含Flow-GRPO式Itô积分。作者推导出等价的方差缩减值梯度形式,恢复AWM和DiffusionNFT的前向匹配结构,把两类方法的差异归因于方差缩减而非RL原则。在SD3.5-M和Qwen-Image模型上的实验验证了这一解释,并取得优于既有扩散RL基线的结果。论文Flow-GRPOAWMDiffusionNFT推荐理由:这篇论文把Flow-GRPO、AWM、DiffusionNFT几套方法统一到一个框架里,说清了它们差别只是方差缩减,还在SD3.5-M和Qwen-Image上跑赢了之前的方案。原文稍后读已读值得跟进有用关注 Flow-GRPO
10:16官方账号arXiv cs.LG@Xiaohong Chen, Yuling Jiao, Lican Kang, Jerry Zhijian Yang, Chen Zhong论文提出用条件扩散模型估计奖励函数和转移核,以构建离线强化学习中的最优Bellman算子。理论给出该算子在总变差距离下的非渐近收敛速率,以及Q*估计的L2收敛率O(n^{-β/(d_x+d_a+2β)})。该分析不依赖完整性假设,状态维度d_x、动作维度d_a和Hölder平滑度β决定了收敛速度。论文扩散模型离线强化学习Q*估计推荐理由:这篇用扩散模型估计奖励和转移核,再学Q*,收敛率给得很细,还绕开了RL里常见的完整性假设。原文稍后读已读值得跟进有用关注 扩散模型
11:31官方账号arXiv cs.LG@Tianyi Li, Yaxin Luo, Xinyi Shang, Zhiqiang ShenDARTree是一种免训练的推测性解码方法,将预训练的自回归修正头从链式扩展为树结构,以加速大语言模型推理。它通过批量扩展和评分构建固定宽度的候选树,再经最佳优先剪枝选出验证树,无需顺序堆操作。在七个数学、代码和聊天基准上,DARTree在全部四种模型-温度配置中取得最高平均接受长度和加速比,单轮验证最多接受12.97个token,比DFlash高98.6%,比Domino高27.9%,相比本地自回归解码实现最高9.73倍无损加速。论文DARTree推测解码扩散模型推荐理由:这论文搞了个叫DARTree的采样方法,不用训练就能让模型跑得更快,最多比原来快9倍多,数学和代码任务上都有效。原文稍后读已读值得跟进有用关注 DARTree
11:24官方账号arXiv cs.LG@Martin J. Wainwright论文提出路径解析的数据几何测度“去掩码增长复杂度”(UGC),用于分析掩码扩散离散采样。UGC局部增量直接控制KL离散化误差,统一了伯努利子集和固定基数去掩码方案。在log-reveal-odds坐标下,该方法可生成单块与多块优化调度,并量化按数据几何分配计算量的收益。作者证明UGC增量可从样本中估计,从而得到达到给定KL误差的认证最优采样器,迭代复杂度在常数因子内逼近oracle过程。示例显示自适应块相比粗粒度调度可带来√d量级的维度相关改进。论文Masking DiffusionUGC扩散模型推荐理由:想省离散扩散采样算力?这篇用UGC度量自动排去掩码节奏,常数个块逼近理论最优误差,给√d维数增益例子。原文稍后读已读值得跟进有用关注 Masking Diffusion
18:10官方账号arXiv cs.LG@He-Yen Hsieh, H. T. KungReRound是一种后训练量化方法,针对标准RTN在量化接近区间中点的权重时固有的中点模糊性问题。它训练一个条件扩散模型生成低比特权重的连续重建,作为确定舍入方向的引导信号。ReRound引入容差度量,对中点附近权重用扩散重建,对边界附近权重用RTN,并通过扫描容差参数选择与原始全精度权重奇异值最匹配的候选。在3比特和4比特量化下,ReRound在小型LLM上持续优于RTN,且精度超过多种无校准方法,与依赖校准的方法相当,推理时无额外开销。该方法适用于LLM之外的AI模型,论文聚焦于小型LLM。论文ReRound量化扩散模型推荐理由:如果你在做低比特量化,ReRound用扩散模型解决RTN的中点模糊,3/4比特下比RTN更准,还不用校准数据,值得看看。原文稍后读已读值得跟进有用关注 ReRound
10:48官方账号arXiv cs.LG@Zhuotao Jin, Xiaoyun Wang, Nicholas Brawand, Roman Zubatyuk, Atul Thakur, Eric Qu, Boris Kozinsky, Justin SmithDynaCrys是一种晶体生成模型,通过耦合符号扩散过程让空间群与Wyckoff占据和元素共同演化。其空间群转移遵循晶体学子群关系,并借助预训练对称性码本提供共享的Wyckoff词汇表示。在两个独立松弛评估引擎的大规模评测中,DynaCrys在稳定、独特和新颖晶体的对称性感知发现上达到最佳性能。它还支持快速采样,生成结构具有低松弛诱导位移。AI模型DynaCrys晶体生成扩散模型推荐理由:DynaCrys把空间群和元素组成一起做扩散,两个评测引擎下都是最好成绩,生成还快,搞材料的人可以看看。原文稍后读已读值得跟进有用关注 DynaCrys
18:25官方账号Decoder@Jonathan KemperGoogle DeepMind将Gemma 4改造成扩散模型DiffusionGemma,训练成本不到原始预算的10%。该模型一次并行生成256个token,推理速度约每秒1500个token。在基准测试中,DiffusionGemma的质量仍落后于原始自回归模型,尤其在推理任务上差距明显。AI模型DiffusionGemmaGemma 4Google DeepMind3 个信源在谈事件专题推荐理由:Google DeepMind把Gemma 4改装成扩散模型DiffusionGemma,训练便宜十倍,生成快,但推理质量比原版差。适合想低成本做扩散模型的人看看。原文稍后读已读值得跟进有用关注 DiffusionGemma
09:23官方账号arXiv cs.LG@Zehua Chen, Junyou Wang, Yuxuan Jiang, Zhenying Fang, Yusheng Dai, Jianfei Chen, Ziwei Liu, Jun ZhuTD-V2A是一种基于扩散模型的视频到音频生成方法,利用时间差异作为区分视频与图像的关键表示。研究对比了帧级和特征级的时间差异,发现特征级更有效。该方法引入分层持续学习策略和退火时间差异引导,在基准数据集上取得优于对比音视频预训练的效果。论文TD-V2A视频生成音频生成推荐理由:这篇论文提出用时间差异做视频生成音频,不用额外网络,效果还超过了对比预训练方法,值得做V2A的人看看。原文稍后读已读值得跟进有用关注 TD-V2A
12:08官方账号arXiv cs.LG@Seyed Kahaki, Shijie Li, Weijie Chen, Nicholas Petrick该论文评估了条件扩散模型生成的合成组织病理图像质量。研究发现传统FID和IS指标依赖ImageNet预训练特征,在病理图像上区分度有限。研究者提出用病理预训练基础模型改进FID和IS,并在四个基准数据集上训练条件扩散模型。改进后的IS与下游细胞核分割性能的相关系数为0.6096(p=0.0122),优于原始IS的0.0708。结果表明增加训练数据多样性比提升单图视觉保真度对分割模型更有帮助。论文扩散模型病理图像FID推荐理由:这篇论文用病理数据预训练模型改进了FID/IS指标,发现比ImageNet特征更贴合下游分割任务,搞病理AI的值得看。原文稍后读已读值得跟进有用关注 扩散模型
12:03官方账号arXiv cs.LG@Yuanshen Guan, Zipeng Feng, Zhiwei Xiong, Peiqin Sun论文提出 Latent Reward Registers,在冻结的 Diffusion Transformer(DiT)输入序列中加入可学习的 register token,直接从中间噪声潜在表示估计最终偏好奖励。相比稀疏终端奖励,该方法在整个去噪过程提供稠密、可微的奖励信号。训练策略 RG-OPD 在在线策略轨迹上蒸馏奖励梯度,GPU 时间最多减少 33 倍,超过在线强化学习基线。推理策略 RGS 无需参数更新即可引导采样,在无训练方法中达到新 SOTA。在高噪声水平 u=0.8 时,寄存器在潜在奖励模型中成对准确率最高。论文Latent Reward RegistersDiffusion TransformerRG-OPD推荐理由:这篇论文给扩散模型加了个奖励寄存器,不用改生成器就能获得稠密奖励,训练比在线 RL 快 33 倍,做生成对齐的可以看看。原文稍后读已读值得跟进有用关注 Latent Reward Registers
11:50官方账号arXiv cs.LG@Chenhan Xiao, Xinyu He, Haoran Li, Hanghang Tong, Yang Weng论文arXiv:2608.03878提出可行性感知分布学习框架,用分层扩散模型学习电网拓扑、支路参数和负荷曲线的联合分布。生成过程分为三个阶段:拓扑生成、支路参数生成、负荷曲线生成,并在训练中嵌入AC潮流可行约束。在基准系统上的实验显示,该方法显著提升AC可操作性和故障鲁棒性,同时保持高统计保真度,且无需事后优化。论文合成数据扩散模型电力系统推荐理由:这篇论文用分层扩散模型学电网数据分布,生成场景不用后处理就能过AC潮流验证,做电力系统研究可参考。原文稍后读已读值得跟进有用关注 合成数据
12:52官方账号arXiv cs.AI@Qiushi Lin, Chaojie Zhang, Íñigo Goiri, Aditya Akella, Ricardo Bianchini, Jovan StojkovicAtumAI 是 arXiv 上的一篇论文提出的数据中心控制平面策略生成框架,能把策略设计从数月工程缩短为撰写一段文字描述。它通过 Datacenter Task Compiler 把自然语言目标编译为形式化、可搜索的规格,再由 Evolutionary Design Discovery Loop 结合扩散模型、进化算法和代理模型搜索候选策略。论文在负载放置、资源扩缩和功耗管理三个控制任务上测试,AtumAI 生成的策略均优于专家手工设计的基线。论文AtumAI智能体数据中心推荐理由:AtumAI 能自动写数据中心控制策略,你输入一句话它就出方案,论文里三个任务都赢过专家手调基线。原文稍后读已读值得跟进有用关注 AtumAI
12:24官方一手arXiv: OpenAI@Masahiro Oda这篇综述聚焦扩散模型与大型语言模型在医学影像处理中的应用。文中以DALL-E 3、Stable Diffusion为例介绍图像生成模型,以ChatGPT、Gemini为例介绍文本生成模型。文章概述了这些模型在诊断报告生成、医学摘要等医疗支持任务中的用途。还探讨了基础模型的构建方法及其在医学领域的应用,并提出了利用国家级数据与算力开发医学AI的路径。论文医学影像扩散模型大语言模型推荐理由:这篇arxiv论文把扩散模型和大语言模型在医学影像里的应用讲得挺清楚,还介绍了基础模型怎么建,适合想了解医疗AI技术路线的人。原文稍后读已读值得跟进有用关注 医学影像
12:03官方账号arXiv cs.LG@Shengzhi Deng, Chenqi Ye, Yanze Guo扩散模型在有限精度硬件上使用的随机性由伪随机规则产生,轨道结构可能成为可学习输入。研究用小型多层感知机预测轨道下一值,并用扩散探针将真实图像替换为随机张量。在MNIST和CIFAR-10上,不同伪随机源产生明显不同的扩散损失和生成质量。归一化后,探针损失与真实数据扩散损失近似遵循经验幂律,两个数据集指数不同。论文扩散模型伪随机MNIST推荐理由:这篇论文发现伪随机数的选择会影响扩散模型的生成质量,不是随便什么随机源都行,看看它是怎么测的。原文稍后读已读值得跟进有用关注 扩散模型
11:50官方账号arXiv cs.LG@Leda Wang, Zhehao Xu, Qiang Liu, Harrison H. Zhou该论文研究c-Rectified flow,这是对纠正流引入成本项的一类变体,FLUX.1和Stable Diffusion 3背后的生成框架正是纠正流。高斯案例显示,普通纠正流只有在源和目标协方差矩阵可交换时才收敛到最优传输耦合;而迭代c-Rectified flow在紧性和一致可积条件下总能收敛到最优传输耦合。作者还针对二次和强凸位移成本建立了投影稳定假设下的单步收缩与指数收敛保证。在Hölder球假设下,他们得到极小极大最优的分数估计速率,用于迭代c-Rectified flow后可在d≥3获得速率最优的最优传输估计,d=1,2时接近参数速率。论文Rectified flowc-Rectified flow最优传输推荐理由:普通Rectified flow可能不收敛到最优传输,c-Rectified flow能保证收敛,d=1,2还有近参数速率。做生成模型可以读。原文稍后读已读值得跟进有用关注 Rectified flow
09:36官方账号arXiv cs.AI@Zhihao Zhu, Hanlin Shang, Mingwang Xu, Feipeng Cai, Zhuolin He, Yaoyi Li, Jianhua Han, Hang Xu, Siyu ZhuWAM-Diff2是一种多任务离散扩散VLA框架,通过三阶段分层蒸馏将预训练自回归模型转化为并行扩散模型。该方法解决了自回归解码的高延迟和暴露偏差问题,同时保留多任务视觉-语言推理能力。在驾驶理解、感知和规划基准上,WAM-Diff2与自回归基线性能持平。推理加速达2.8倍,结合FlashInfer和CUDA Graphs系统优化后最高可达15.1倍。AI模型WAM-Diff2VLA扩散模型推荐理由:它把慢吞吞的自回归VLA模型变成并行扩散模型,性能不掉,推理快2.8倍,还能跑自动驾驶多任务。原文稍后读已读值得跟进有用关注 WAM-Diff2
06:27官方账号Latent Space (swyx)(博客/媒体)76°Baseten刚完成130亿美元F轮融资,成为推理工程领域的头部公司。本文由Philip Kiely和Ali Taha撰写,是一份推理工程大师课。内容聚焦自回归推理与扩散推理两大方向。适合从事AI模型部署的工程师阅读。技巧Baseten推理工程自回归模型推荐理由:Baseten刚融了130亿美元,这篇大师课把自回归和扩散的推理工程讲透了,搞部署的可以看。原文稍后读已读值得跟进有用关注 Baseten
23:48Suhail@SuhailSuhail 在 X 上发文称,他仍对扩散模型未能达到与因果 Transformer 相近的影响力感到惊讶。目前扩散模型的实际影响与 Transformer 相比仍差至少一个数量级。Transformer 已成为现代 AI 的基础架构,而扩散模型主要局限于图像生成等领域。行业扩散模型TransformerSuhail推荐理由:做 AI 的人都在聊 Transformer 和扩散模型,这条推文一句话点出两者的现实差距,值得一看。原文稍后读已读值得跟进有用关注 扩散模型
11:31官方账号arXiv cs.LG@Quang Bui, Sparsh Roy, Akash Gundimeda, Davin Yin该论文研究了基于扩散模型的提议在连续代数约束求解中的有效性。在候选条件修复排序中,K个增强选项的排名器以少量调用达到穷举搜索上限:平衡非线性菜单准确率0.997 vs 0.236(p<10^-70),多种子平均0.982±0.006。提出的MARC系统将约束转化为因子图,用图神经扩散去噪器提出赋值,再通过精确计算机代数能量下降优化并由符号检查器验证。与随机多起点相比,学习式提议只在高维空间明显胜出(低维持平,变量耦合时优势消失)。在八个真实系统(机器人、定位、优化、代数)中,经典随机多起点全部求解,无一处于学习有利区间。论文MARC扩散模型约束求解推荐理由:这篇论文用严格的对照实验告诉你:扩散模型在约束求解里什么时候有用、什么时候没用,结果很反直觉——真实系统里随机多起点反而全赢了。做AI for science和优化的人值得看看。原文稍后读已读值得跟进有用关注 MARC
11:48官方账号arXiv cs.LG@Sungjae Park, Shubham Tulsiani通用操作策略多采用基于大预训练骨干的动作分块流策略,但开环运行导致无法反应中途输入,牺牲反应性,且重规划因感知-动作管线慢而受限。πR²基于扩散强制噪声调度,提出快慢通道分离(本体感觉每tick更新,视觉语言特征异步更新)和延迟自适应流调度,可在单步去噪内发出动作。在GR00T-N1.7上微调后,于真实xArm6+XHand平台实现约25Hz闭环重规划(每40ms响应一次观察),比基线快4倍。在仿真和真实操作任务中,πR²相较最强基线成功率分别提升23%和30%。论文πR²GR00T-N1.7xArm6推荐理由:操作策略终于能实时闭环了!πR²让大模型每40ms重新规划动作,比基线快4倍,成功率提升30%,特别适合动态环境。原文稍后读已读值得跟进有用关注 πR²
09:37官方账号arXiv cs.LG@Abhishek A. Sabnis, Mihai Mitrea, Lya Lugon, Karine Sartelet, Marc Bocquet, Xiaoyuan Cheng, Shupeng Zhu, Sibo Cheng该论文提出一种基于扩散生成模型的框架,用于从稀疏监测站观测数据重建巴黎的四种主要污染物(NO2、O3、PM2.5和PM10)的分布。模型在模拟的全场数据上训练,并在9至28个监测站的真实观测上评估,与确定性深度学习模型进行基准对比。实验表明,生成模型在模拟验证数据上达到高结构相似度,并通过功率谱分析生成更符合现实的污染空间模式。作者还引入数据增强方法,使模型无需重新训练即可泛化到实际观测场景。论文扩散模型空气质量重建巴黎推荐理由:研究者用扩散模型从少量监测站重建全城空气污染图,比传统确定性方法生成的模式更真实,还能跨时间迁移,值得关注。原文稍后读已读值得跟进有用关注 扩散模型
14:32量子位@鹭羽研究人员发布首个面向Agent任务的扩散模型,支持128K上下文长度,通过边行动边纠错机制在长程Agent评测中追平自回归模型。该模型在多个Agent基准任务上表现与自回归模型相当。AI模型扩散模型Agent128K上下文推荐理由:扩散模型也能跑Agent任务了,128K上下文还能边做边改,效果和自回归差不多,值得看看。原文稍后读已读值得跟进有用关注 扩散模型
11:57官方账号arXiv cs.LG@Bingnan Li, Haozhe Wang, Haozhong Xiong, Fangtai Wu, Jinpeng Yu, Yang Shi, Jiaming Liu, Ruihua Huang本文研究在策略蒸馏(OPD)中分类器自由引导(CFG)的作用。现有OPD方法直接匹配教师和学生模型的引导速度,但在分支级别存在欠辨识问题:正负分支误差可相互补偿。作者发现,在共享负条件时匹配仍有效,但当教师负分支包含学生无法获取的特权信息时,会导致负分支不对称(NBA)失败模式。为解决NBA,提出正方向匹配(PDM),分别约束正预测和CFG条件方向。将PDM应用于稠密到稀疏视频控制,比朴素引导匹配更鲁棒有效。论文扩散模型知识蒸馏分类器自由引导推荐理由:这篇论文发现了现有扩散蒸馏方法在CFG下的一个隐蔽问题,并给出了一个简单的修正方案。做扩散模型蒸馏或视频生成的同学可以看看。原文稍后读已读值得跟进有用关注 扩散模型
10:57官方账号arXiv cs.LG@Ahmed M. Abuzuraiq, Philippe Pasquier论文提出一种面向创意实践的可解释AI方法,让艺术家能检查、修改和调试扩散模型内部结构。作者在ComfyUI的节点工作流中集成了交互式层选择与干预控件,实现模型弯曲。通过对Stable Diffusion 1.5进行定性与定量分析,发现操纵不同组件(如UNet层)会产生相对一致的视觉效应。该方法帮助艺术家建立层级的直觉,理解模型各部分如何影响生成图像。论文Stable DiffusionComfyUI扩散模型推荐理由:这篇论文告诉你,艺术家也能像玩材料一样玩扩散模型内部。他们在ComfyUI做了交互工具,能直接操纵Stable Diffusion的层,看到具体变化。不是理论说教,是真能动手调的。原文稍后读已读值得跟进有用关注 Stable Diffusion
11:38官方账号arXiv cs.LG@Yann Bouquet, Alireza Khodamoradi, Kristof Denolf, Mathieu SalzmannKroQuant提出一种Kronecker结构可逆变换,对每个32元素激活块进行在线量化,参数少于per-channel缩放的一半。在MI350 GPU上,KroQuant量化核比SmoothQuant核快14%。在PixArt-Σ、SANA和FLUX.1-schnell上以W4A4(MXFP4e2)量化,KroQuant在MJHQ-30K和SDCI上输出比SVDQuant和LoRaQ更接近FP参考,同时保持或提升图像质量。该方法通过离线LoRaQ权重校准吸收残差权重量化误差。论文KroQuant量化扩散模型推荐理由:这篇论文发了KroQuant,用Kronecker结构做激活变换,W4A4量化又快又准,比SVDQuant和LoRaQ结果好,还省参数。原文稍后读已读值得跟进有用关注 KroQuant
10:34官方账号arXiv cs.AI@Yueyi Liu, Chi Zhang, Sen Cui, Miao Liu测试时调优(TTT)在预训练扩散模型中用于视频编辑,但存在Prior Collapse问题,导致模型丢弃文本条件和空间潜在变量。ElasticTTT通过目标分布正则化防止过拟合记忆,对比CFG引导推理远离源偏置,以及异步噪声调度保留未编辑区域。在一次性视频编辑任务上,该方法相较现有TTT方法实现了更优的语义保真度和编辑质量。论文ElasticTTT视频编辑扩散模型推荐理由:这篇论文解决了视频编辑时模型丢失先验的问题,用三种新技巧让编辑更精准,效果比以前的TTT方法好得多。原文稍后读已读值得跟进有用关注 ElasticTTT
09:27官方账号arXiv cs.AI@Michael Romei de Socio, Gian Luca Pozzato, Alessio Merlo该研究提出一种条件扩散模型,从部分观测生成未来图状态轨迹,并叠加符号约束层(硬过滤、软加权、投影修复)提升结构可行性。在紧凑图场景下,模型无效概率质量为0.002996;在中等复杂度依赖图场景下升至0.155929。硬过滤剔除所有无效轨迹,保留84.4%样本;软加权保持有效样本量但增益有限。分析表明依赖约束是几乎全部不可接纳性的来源。论文扩散模型动态图系统符号约束推荐理由:这篇论文用具体数字告诉你,统计上合理的轨迹未必结构可行,扩散模型加符号约束能解决。看中型图场景下0.156的无效概率怎么被硬过滤砍掉。原文稍后读已读值得跟进有用关注 扩散模型
16:38官方一手Hugging Face: Blog(博客/媒体)精选Hugging Face 宣布将 Nunchaku 推理引擎集成到 Diffusers 库,支持 4-bit 量化扩散模型。开发者可以直接用 Diffusers API 加载 Nunchaku 格式的模型。该方案能将模型显存占用降低约 75%,同时保持生成质量。目前主要适配 Stable Diffusion 系列模型。AI产品NunchakuDiffusersHugging Face推荐理由:Hugging Face 把 Nunchaku 的 4-bit 量化推理直接塞进 Diffusers 了,以后用 SD 省一半显存,笔记本也能跑。原文稍后读已读值得跟进有用关注 Nunchaku
12:12官方账号arXiv cs.LG@Yuchen Jiao, Na Li, Changxiao Cai, Yuxin Chen, Gen Li本文提出PDDIM算法,利用DDIM类采样器求解线性逆问题。该方法对标准DDIM更新进行轻量坐标调整,并显式融入测量模型,根据观测信噪比与扩散信噪比的比较切换更新策略。理论证明PDDIM收敛到观测条件下的贝叶斯后验。在多个图像恢复任务中,PDDIM在大部分评估指标上超过现有扩散后验采样方法。论文PDDIMDDIM扩散模型推荐理由:这论文提出PDDIM算法,用DDIM采样器解线性逆问题,有理论保证,代码改动小,效果还最好。原文稍后读已读值得跟进有用关注 PDDIM
00:59官方账号MIT CSAIL@MIT_CSAIL精选78°MIT研究人员提出一种新算法,能在指数级更少的采样步骤内达到与标准扩散模型相同的精度。该算法可大幅提升图像生成等扩散AI系统的效率。相关论文在ICML 2023荣获杰出论文奖(Outstanding Paper)。论文MIT扩散模型采样加速推荐理由:MIT搞了个新算法,采样扩散模型快了很多,还拿了ICML最佳论文奖,做图像生成的朋友可以看看。原文稍后读已读值得跟进有用关注 MIT
09:34官方账号arXiv cs.LG@Evangelia Rafaela Frastali, Achyut Paudel, Maryam Golbazi, Frank LiuApeliotes框架结合全球再分析数据、预训练天气基础模型和区域扩散模型,生成公里级多变量大气场。在垂直风廓线预测上误差低于3%,10米风速相关性达0.91,2米温度相关性达0.99,NRMSE分别为0.42和0.17。该方法比传统动力降尺度计算成本大幅降低,可扩展至不同区域和变量。AI模型Apeliotes扩散模型天气预测推荐理由:这个框架用扩散模型做公里级天气预测,垂直风误差不到3%,比传统方法快很多,做精细化气象预报的朋友可以看看。原文稍后读已读值得跟进有用关注 Apeliotes
05:32OpenRouter@OpenRouterAIOpenRouter 发布 Krea 2 Medium,定位为快速、低成本的通用图像生成起点。该模型在插画、动漫、绘画和表现主义风格上生成稳定一致。相比 Krea 2 完整版,Medium 版推理速度提升约 40%,API 定价降低 60%,适合批量创作和实验。AI模型Krea 2 MediumOpenRouter图像生成推荐理由:OpenRouter 出了个 Krea 2 Medium,速度快一半、价格打六折,画插画和动漫风格很稳,适合日常批量出图。原文稍后读已读值得跟进有用关注 Krea 2 Medium