#扩散模型
Spotlight系统用便宜的Spot GPU做DiT强化学习后训练,成本降低1.4-6.4倍,训练快4倍,适合预算有限的团队。
这篇论文用MPMWorlds测试了AI看视频写物理代码的能力,发现代码生成稳但缺位置感知,扩散模型短时准但长期漂移,混合模型效果最好。
这篇论文提出了 EPS 方法,能更高效准确地求解线性逆问题,在多个基准上表现优异,且计算开销低。
Blatt 把视觉生成从 GANs 到 FLUX 的演进脉络讲透了,做图像生成或视觉 AI 的开发者能从中看到技术拐点,值得花 10 分钟听一下。
本地运行 LLM 的开发者终于有了速度新选择——DiffusionGemma 的 4 倍加速意味着更流畅的交互体验,用 atomic[.]chat 的团队可以直接在单卡上体验,值得一试。
扩散模型推理加速有了新解法——块验证让草稿接受率更高,做生成式 AI 推理优化的团队可以直接参考 Free Drafter 的无训练方案,实测有 6.3% 的提速收益。
做3D人体运动生成的团队终于有了摆脱昂贵3D标注的可行方案——VideoMDM用2D视频就能训练出接近3D监督水平的模型,做动画、运动分析或虚拟人开发的可以直接试。
字体设计团队和AI生成研究者可以关注这个方案——它解决了少样本字体生成中全局与局部细节难以兼顾的痛点,直接提升字形质量和风格一致性。
DiffusionGemma 解决了 Transformer 逐词生成速度慢、无法回头修改的痛点,做文本生成或长内容创作的开发者可以直接在消费级显卡上跑,体验 1000+ tokens/s 的生成速度。
本地 AI 推理终于有了速度突破——DiffusionGemma 让低带宽设备也能高效运行,做边缘部署或本地应用的开发者可以直接从 Hugging Face 下载试试。
DiffusionGemma 把文本生成速度拉到 4 倍,还彻底开源,做本地部署或加速日常 workflow 的开发者可以直接拖权重玩。
DiffusionGemma 为文本生成开辟了新路径,追求推理速度的开发者可以尝试这种非自回归方案,尤其适合对实时性要求高的场景。
本地 LLM 用户终于等来速度突破——DiffusionGemma 的并行生成机制让推理快 4 倍,做本地部署或边缘计算的开发者可以直接在 18GB 显存下体验,值得一试。
每秒 1000+ tokens 的生成速度让推理成本大幅降低,做大规模文本生成或实时应用的开发者值得关注,量化后 18GB VRAM 就能跑,门槛很低。
文本扩散模型的研究者终于有了一个强大的开放基线——DiffusionGemma 同时生成整段文本并支持实时纠错,做生成式 AI 研究的团队值得下载权重试试。
电商和广告设计团队终于有了解决外绘伪影的实用方案——CCE-Diffusion能直接减少背景中与产品重复的语义区域,让产品更突出。做图像生成或商品展示的开发者可以试试集成这个即插即用模块。
做生成模型的研究者会发现,PTL-Diffusion 用周期终端分布解决了流形结构丢失的痛点,在低维流形数据上效果明显,值得在点云或人脸生成任务上试试。
做工业视觉异常检测的团队终于有了应对真实场景变化的方案——视觉提示和双教师监督直接解决了传统方法对背景、视角敏感的痛点,值得在产线上试跑。
NVIDIA 的 PixelDiT 解决了传统扩散模型因预训练编码器压缩导致的质量损失问题,做图像生成的研究者和开发者值得关注——它可能改变现有生成流程的底层设计。
处理表格数据的团队终于有了区分“不该填”和“该填”缺失值的工具——Diff-Joint解决了传统填补方法盲目恢复所有缺失的痛点,做数据清洗或医疗、金融等缺失值有语义含义的开发者可以直接试。
Ethan He 把模型训练和交互设计的底层逻辑讲透了,做模型训练或产品设计的开发者看完会有启发,特别是关于迭代速度和交互未来的观点值得反复琢磨。
做科学数据分析和时序建模的团队,终于有了能双向推理、探索多种可能性的工具,比传统确定性预测灵活太多,建议做地球科学或生物物理的开发者点开看看。
做机器人操控或强化学习的团队,终于有了一个不更新大模型也能微调扩散策略的轻量方案——LP-DS 在保持动作多样性的同时提升回报,建议试试看能否解决你的分布偏移问题。
Ethan He 对 AI 前沿的预判直击要害,做视频生成、智能体或世界模型的开发者看完会有启发——尤其是关于迭代速度和智能体方向的洞察,值得点开细品。
做视频生成或3D人体动画的团队终于有了不依赖渲染的精准控制方案——直接压缩3D网格token,避免2D引导的伪影问题,建议做运动控制或虚拟人应用的开发者点开看看。
这篇论文揭示了扩散模型在图到文本任务中的独特解码机制,做结构化文本生成或知识图谱相关工作的开发者值得关注,尤其是SFT反而有害的发现可能改变你的微调策略。
做视频生成的研究者或开发者,如果被长视频多事件生成的一致性困扰,TunerDiT 的零训练方案直接可用,值得关注其事件边界控制与提示融合的设计。
做图像逆问题或扩散模型后验采样的研究者,这篇论文直接戳中了现有方法“好用但说不清为什么失败”的痛点——有限样本视角给出了可落地的诊断工具,建议点开看看你的采样器是否也在犯这些错误。
对于从事图像恢复、超分辨率等逆问题的研究者,MAP-RPS提供了一种无需重新训练即可在推理时灵活调节失真与感知质量的方法,值得尝试。
Sakana AI 这个框架解决了残差网络训练中梯度回传的瓶颈,做大规模生成模型或分布式训练的团队值得关注——它让每个模块可以独立优化,直接降低显存和通信开销。