#DiT
共 17 条 · 7 天 3 条 · 30 天 7 条
信息流里打上「DiT」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月8日
10月6日
Level-of-Token Diffusion:按需分配算力的多分辨率图像视频生成框架
一篇很巧的论文:让扩散模型在需要细节的地方用细 token、别处用粗 token,预训练模型不用重训就能提速,还能接智能体的规划布局。
10月5日
10月2日
9月29日
9月21日
8月4日
论文11:32
CMuon:基于分块动量正交化加速并稳定Diffusion Transformer训练写了个新优化器CMuon,训练扩散Transformer比AdamW快两倍多,675M模型200轮就跑到FID 1.18,厉害得很。
7月24日
论文11:38
KroQuant: Kronecker结构块变换实现扩散变换器高效后训练量化这篇论文发了KroQuant,用Kronecker结构做激活变换,W4A4量化又快又准,比SVDQuant和LoRaQ结果好,还省参数。
7月22日
论文12:59
Appearance Pointers:扩散变换器的多模态区域控制这篇论文搞了个Appearance Pointers,能让DiT模型精确指定图片不同区域该长什么样,不用重训模型,效果还比那些专门的方法好。
7月14日
论文09:23
Diversify Diffusion with Temperature Sampling and Variance-Corrective Time Shifting 论文想在不重训模型的情况下让扩散模型生成更多样化的结果?这篇论文给出了一个简单有效的技巧:温度采样配合时间偏移,在DiT、Stable Diffusion上都有效果。
7月10日
6月18日
Spotlight:协同种子探索与Spot GPU加速DiT强化学习后训练
Spotlight系统用便宜的Spot GPU做DiT强化学习后训练,成本降低1.4-6.4倍,训练快4倍,适合预算有限的团队。
6月10日
Pose-ICL:3D感知上下文学习实现可控姿态主体定制
做图像生成和主体定制的团队终于有了一个能精准控制姿态的方案——Pose-ICL 用3D感知解决了2D模型的老大难问题,做定制化生成的开发者可以直接试试。
6月1日
论文10:31
TunerDiT:无需训练的多事件视频生成渐进引导方法做视频生成的研究者或开发者,如果被长视频多事件生成的一致性困扰,TunerDiT 的零训练方案直接可用,值得关注其事件边界控制与提示融合的设计。
5月28日
5月20日
腾讯云采用DiT架构实现实时4K超分辨率直播增强
腾讯云把DiT用在了直播场景,解决了传统CNN/GAN画质增强不够自然的问题,做直播、电商、视频平台的团队可以直接关注企业级方案,效果数据(GMV、转化率提升)值得点开看。