6月11日
01:49
01:49Philipp Schmid@_philschmid
78°
DiffusionGemma 是基于 Gemma 4 构建的 26B MoE 扩散语言模型,推理时仅激活 3.8B 参数。它采用并行生成 256-token 块的方式,实现了每秒 1000+ tokens 的生成速度。量化后模型可适配 18 GB VRAM,且采用 Apache 2.0 开源协议。这一架构突破了传统自回归模型的生成瓶颈,为高效文本生成提供了新思路。
事件专题

推荐理由:每秒 1000+ tokens 的生成速度让推理成本大幅降低,做大规模文本生成或实时应用的开发者值得关注,量化后 18GB VRAM 就能跑,门槛很低。
6月10日
6月9日
11:49
11:49官方账号arXiv cs.AI@Mateo Diaz-Bone, Daniel Caraballo, Florian Scheidegger, Thomas Frick, Mattia Rigotti, Andrea Bartezzaghi, Roy Assaf, Niccolo Avogaro, Yagmur G. Cinar, Brown Ebouky, Filip M. Janicki, Piotr S. Kluska, Cezary Skura, Cristiano Malossi
精选
现有异常检测方法在 MVTec 等标准数据集上表现完美,但在真实场景中因物体尺度、视角、背景、光照等变化而失效。该研究提出三项创新:视觉提示管道通过前景-背景掩码隔离物体;在师生模型中解冻教师以提升领域适应性;利用扩散生成合成图像增强数据。基于 Masked Multiscale Reconstruction (MMR) 骨干,该方法在挑战性数据集 AeBAD 上比之前最优方法提升 3.5 个百分点。
推荐理由:做工业视觉异常检测的团队终于有了应对真实场景变化的方案——视觉提示和双教师监督直接解决了传统方法对背景、视角敏感的痛点,值得在产线上试跑。
6月4日
11:05
11:05官方账号arXiv cs.LG@Lixing Zhang, Yidong Ouyang, Weifu Li, Shixiang Zhu, Guang Cheng, Liyan Xie
传统缺失值填补方法假设所有缺失都是随机且应被恢复,但现实中缺失可能来自两种不同来源:有意义缺失(数据本身不存在)和观测缺失(应被填补)。研究者提出Diff-Joint,一个基于扩散的框架,联合建模表格数据与潜在缺失掩码,通过条件采样和不确定性感知聚合迭代优化填补值与缺失标签。实验表明,该方法能有效识别有意义缺失,同时保持竞争性填补精度并提升下游任务性能。
推荐理由:处理表格数据的团队终于有了区分“不该填”和“该填”缺失值的工具——Diff-Joint解决了传统填补方法盲目恢复所有缺失的痛点,做数据清洗或医疗、金融等缺失值有语义含义的开发者可以直接试。
6月3日
10:36
10:36官方账号arXiv cs.LG@Mengdi Chu, Jiaxin Yang, Angus G. Forbes, Nathan Debardeleben, Earl Lawrence, Ayan Biswas, Han-Wei Shen
科学数据分析中,现有机器学习方法多提供确定性前向预测,忽略多种可能结果且不支持反向推理。该研究提出 DiffUNet^2,一种条件扩散模型,支持时间维度上的双向任意生成,捕捉系统演化的概率分布。结合交互式可视化系统,科学家可探索分支时间线、编辑状态并导航概率空间,主动验证假设。在5个跨学科数据集上验证了预测准确性和概率集成质量。该框架将生成模型转化为假设驱动的科学分析工具。
推荐理由:做科学数据分析和时序建模的团队,终于有了能双向推理、探索多种可能性的工具,比传统确定性预测灵活太多,建议做地球科学或生物物理的开发者点开看看。
6月2日
11:11
11:11官方账号arXiv cs.AI@Jingyun Liang, Min Wei, Shikai Li, Yizeng Han, Hangjie Yuan, Lei Sun, Weihua Chen, Fan Wang
该研究提出一种无需渲染的框架,通过将3D人体网格压缩为token,直接输入DiT架构的视频扩散模型,实现精确的人体运动控制。相比依赖2D渲染引导的现有方法,该方法避免了视角依赖伪影和轨迹-姿态不匹配问题。实验表明,该框架在人体运动控制基准上表现优异,证明视频扩散模型通过网格token化能更好地理解3D结构。这项工作为3D感知视频生成提供了新思路。
推荐理由:做视频生成或3D人体动画的团队终于有了不依赖渲染的精准控制方案——直接压缩3D网格token,避免2D引导的伪影问题,建议做运动控制或虚拟人应用的开发者点开看看。
6月1日
5月28日
5月27日
5月26日
5月22日
11:35
11:35官方账号arXiv cs.LG@Javad Parsa, Enis Simsar, Amir Joudaki, Thomas Hofmann, André M. H. Teixeira
精选
SeqLoRA 是一种针对文本到图像扩散模型的高效微调方法,解决了多概念组合生成中的表示干扰问题。现有模块化方法要么依赖昂贵的后处理融合,要么冻结适配子空间,限制了表达力和概念保真度。SeqLoRA 通过双层优化联合优化两个 LoRA 因子,并建立强收敛保证,从理论上证明学习 LoRA 基比固定基方法更有效减少干扰。实验显示,SeqLoRA 在多达 101 个概念上提升了身份保持和可扩展性,无需昂贵融合,减少了属性干扰。
推荐理由:做多概念图像生成的团队终于有了一个兼顾保真度和可扩展性的方案——SeqLoRA 用双层优化解决了 LoRA 的干扰问题,支持上百个概念组合,做个性化扩散模型的开发者值得一试。
5月21日