#扩散模型
这篇论文告诉你,艺术家也能像玩材料一样玩扩散模型内部。他们在ComfyUI做了交互工具,能直接操纵Stable Diffusion的层,看到具体变化。不是理论说教,是真能动手调的。
这篇论文发了KroQuant,用Kronecker结构做激活变换,W4A4量化又快又准,比SVDQuant和LoRaQ结果好,还省参数。
Hugging Face 把 Nunchaku 的 4-bit 量化推理直接塞进 Diffusers 了,以后用 SD 省一半显存,笔记本也能跑。
OpenRouter 出了个 Krea 2 Medium,速度快一半、价格打六折,画插画和动漫风格很稳,适合日常批量出图。
这篇论文找到了CFG在高引导下翻车的数学原因,还给了个零成本修复,CIFAR-10和SD1.5上点FID全胜,做采样的人值得看看。
这篇论文指出了线性注意力在图去噪上的根本局限,并提出 GCA 来补上短板。在 DiGress 上效果持平标准 Transformer 还省了结构特征计算,挺实用的。
这篇论文把VLM做图像编辑时定位不准的老问题挖到底了——原来不是模型不行,是提取信号的方式错了。他们用了个'代理分析'的巧招,把隐藏的定位信号给揪了出来,搞编辑管线的值得一看。
前Llama老大跑去做药了,他们用扩散模型搞的PEARL在OpenBind零样本赢了,共折叠也终于过了门槛。想了解AI怎么设计新药的可以看这个。
这篇论文发现了再流蒸馏的隐藏问题——轨迹匹配可能不够,还提出了一个简单有效的边际对齐正则化,不用额外网络就能提升少步生成质量,值得做扩散加速的人看看。
一个人用一块显卡做出 SIGGRAPH 论文,InfiniteDiffusion 让扩散模型无限生成,Terrain Diffusion 是第一个能学的地形生成器,很厉害。
这篇论文提出Fed-CausalDiff,让联邦学习不仅能拟合历史数据,还能做因果干预模拟。它在四个数据集上比常规方法更准,而且通信开销可控,适合分布式医疗或金融场景。