11:32官方账号arXiv cs.AI@Chuyan Chen, Peng Sun, Kun YuanCMuon是一种针对Diffusion Transformer(DiT)训练的新优化器,通过将参数矩阵分块后再做正交化,解决了原版Muon在后期收敛停滞的问题。在ImageNet 256上,用CMuon训练的675M参数DiT仅用200个epoch就达到FID 1.18。相比AdamW,训练速度提升超过2倍。该方法能有效避免融合张量引发的隐式子空间耦合,保持更新方向准确。论文CMuonMuonDiT推荐理由:写了个新优化器CMuon,训练扩散Transformer比AdamW快两倍多,675M模型200轮就跑到FID 1.18,厉害得很。原文稍后读已读值得跟进有用关注 CMuon
11:38官方账号arXiv cs.LG@Yann Bouquet, Alireza Khodamoradi, Kristof Denolf, Mathieu SalzmannKroQuant提出一种Kronecker结构可逆变换,对每个32元素激活块进行在线量化,参数少于per-channel缩放的一半。在MI350 GPU上,KroQuant量化核比SmoothQuant核快14%。在PixArt-Σ、SANA和FLUX.1-schnell上以W4A4(MXFP4e2)量化,KroQuant在MJHQ-30K和SDCI上输出比SVDQuant和LoRaQ更接近FP参考,同时保持或提升图像质量。该方法通过离线LoRaQ权重校准吸收残差权重量化误差。论文KroQuant量化扩散模型推荐理由:这篇论文发了KroQuant,用Kronecker结构做激活变换,W4A4量化又快又准,比SVDQuant和LoRaQ结果好,还省参数。原文稍后读已读值得跟进有用关注 KroQuant
12:59官方账号arXiv cs.AI@Rahul Sajnani, Yulia Gryaditskaya, Radomír Měch, Srinath Sridhar, Matheus Gadelha论文提出Appearance Pointers,一种紧凑的额外token,用于指导扩散变换器(DiT)在指定空间区域获取正确的纹理、对象身份等外观信息。该方法通过区域对应网络生成token,并用空间聚合机制优化,无需重新训练基础DiT模型即可处理多个区域描述。在多个基准测试上,单模型性能达到或超越针对特定模态的现有方法,实现了首个模态无关的局部多模态控制接口。论文Appearance PointersDiT多模态推荐理由:这篇论文搞了个Appearance Pointers,能让DiT模型精确指定图片不同区域该长什么样,不用重训模型,效果还比那些专门的方法好。原文稍后读已读值得跟进有用关注 Appearance Pointers
09:23官方账号arXiv cs.LG@Peizhuo Li, Emre Aksan, Alexandru-Eugen Ichim, Thabo Beeler, Olga Sorkine-Hornung该论文提出一种无需重新训练的推理方法,通过温度采样(γ<1)和方差校正时间偏移来提升扩散模型的输出多样性。核心思想是:对分数进行γ缩放虽能重加权模式,但会膨胀每模式的方差;而在偏移的时间步查询网络并缩放分数,可抵消方差膨胀。在DiT、Stable Diffusion和Motion Diffusion模型上验证了该方法能一致提升多样性,同时保持样本质量和条件保真度。论文还发现时间干预时机可实现粗到细控制:高噪声阶段驱动跨模式的组合多样性,低噪声阶段驱动固定组合下的局部外观变化。论文DiTStable DiffusionMotion Diffusion推荐理由:想在不重训模型的情况下让扩散模型生成更多样化的结果?这篇论文给出了一个简单有效的技巧:温度采样配合时间偏移,在DiT、Stable Diffusion上都有效果。原文稍后读已读值得跟进有用关注 DiT
11:50官方账号arXiv cs.LG@Yiwei Zhou精选论文构造了光滑得分场,其正向边缘L^2误差任意小,但Euler-Maruyama离散化后所有正阶矩发散。虽然路径空间总变差距离可以任意接近精确反向过程,但每个Wasserstein距离W_p (p≥1)发散。在固定有限神经架构(如DiT风格网络)中,同样存在一族有界全局Lipschitz去噪器,其正向边缘误差和路径总变差趋于零,但Euler-Maruyama端点所有W_p发散。对于紧支撑数据,将去噪器投影到包含支撑的已知有界闭凸集上可保持点态精度并给出格点一致矩界,实验显示此投影能抑制罕见数值轨迹的异常增长。论文Score MatchingDiffusion SamplingDiT推荐理由:这篇论文发现了一个反直觉的事:扩散模型正向得分训练误差很小,但采样时数值可能不稳定,矩甚至发散。想避开采样坑的可以看看。原文稍后读已读值得跟进有用关注 Score Matching
09:26官方一手arXiv: DeepSeek@Ruiqi Lai, Dakai An, Wei Gao, Ju Huang, Siran Yang, Jiamang Wang, Lin Qu, Dmitrii Ustiugov, Wei Wang精选DiT强化学习后训练需要数千块高端GPU,成本极高。Spotlight系统利用Spot GPU(价格低69-77%)和种子探索技术,将训练速度提升4倍。该系统通过带子集探索规划器最大化奖励方差,弹性序列并行在预emption时毫秒级恢复,并采用拉取式调度平衡负载。在Qwen-Image后训练中,Spotlight达到相同验证分数的成本降低1.4-6.4倍,在DeepSeek-OCR和Geneval数据集上512×512和1280×1280分辨率下图像质量更优。论文SpotlightDiTQwen-Image推荐理由:Spotlight系统用便宜的Spot GPU做DiT强化学习后训练,成本降低1.4-6.4倍,训练快4倍,适合预算有限的团队。原文稍后读已读值得跟进有用关注 Spotlight
12:36官方账号arXiv cs.AI@Xuan Han, Yihao Zhao, Mingyu You精选Pose-ICL 是一种无需微调的框架,通过3D感知的上下文学习(ICL)实现姿态可控的主体定制。其核心机制 Surface-Anchored Position Embedding (SAPE) 将图像标记锚定到体积边界框的表面坐标,赋予模型显式的3D感知能力。该方法解决了现有2D模型在主体定制中姿态不准确和跨姿态外观不一致的问题。实验表明,Pose-ICL 在3D资产和真实主体上均显著优于现有方法,在姿态准确性和身份一致性上表现突出。该框架与现有DiT模型兼容,可直接应用。论文主体定制3D感知上下文学习推荐理由:做图像生成和主体定制的团队终于有了一个能精准控制姿态的方案——Pose-ICL 用3D感知解决了2D模型的老大难问题,做定制化生成的开发者可以直接试试。原文稍后读已读值得跟进有用关注 主体定制
10:31官方账号arXiv cs.AI@Ruotong Liao, Guowen Huang, Qing Cheng, Guangyao Zhai, Lei Zhang, Xun Xiao, Thomas Seidl, Daniel Cremers, Volker TrespTunerDiT 提出了一种无需额外训练的多事件视频生成方法,通过分析扩散变换器(DiT)的去噪轨迹,发现文本条件从全局布局到细节的转变点。该方法包含两个关键组件:事件分区掩码(强制事件边界并允许过渡带)和跨事件提示融合(注入相邻事件语义进行后期细化)。在自建的多事件基准测试 Meve 上,TunerDiT 在 8 个指标上达到最优,并能在视频一致性和事件分离之间进行可调权衡。随着事件数量增加,文本对齐性能提升,显示出扩展潜力。论文扩散模型视频生成多事件生成推荐理由:做视频生成的研究者或开发者,如果被长视频多事件生成的一致性困扰,TunerDiT 的零训练方案直接可用,值得关注其事件边界控制与提示融合的设计。原文稍后读已读值得跟进有用关注 扩散模型
19:58rohanpaul_ai@rohanpaul_ai研究发现图像扩散Transformer训练效率低下的根源在于残差连接,而非注意力或编码器。残差连接导致信号膨胀、梯度消失和特征冗余,尤其不适合扩散模型这种多步去噪任务。作者提出扩散自适应路由(Diffusion-Adaptive Routing),让每层根据去噪时间步动态选择前层输出,从而在相同图像质量下减少8.75倍训练迭代。该工作没有引入新数据集或注意力机制,而是质疑了从语言Transformer继承的残差结构。论文扩散模型Transformer残差连接推荐理由:扩散模型研究者终于找到了训练瓶颈的隐藏位置——残差连接,8.75倍加速意味着更低的训练成本,做图像生成的团队值得关注这个新路由方案。原文稍后读已读值得跟进有用关注 扩散模型
16:03官方账号腾讯混元 Tencent Hunyuan@TencentCloud精选腾讯云宣布采用扩散变换器(DiT)架构,为全场景直播提供实时视频质量增强和超分辨率服务。相比传统CNN和GAN模型,DiT能生成更自然、高保真的纹理。该方案统一了实时4K超分辨率、压缩伪影去除、帧率优化和精准ROI增强等关键能力。通过Causal DiT和滚动缓存加速,实现了稳定60 FPS的实时推理性能,延迟极低。该技术有效提升了流媒体QoE、电商GMV和广告转化率。AI产品DiT扩散变换器视频增强推荐理由:腾讯云把DiT用在了直播场景,解决了传统CNN/GAN画质增强不够自然的问题,做直播、电商、视频平台的团队可以直接关注企业级方案,效果数据(GMV、转化率提升)值得点开看。原文稍后读已读值得跟进有用关注 DiT