AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

潜在扩散模型

共 2 条相关 AI 资讯
8月19日
05:55
05:55官方账号Pika Labs@pika_labs
Pika Soundtrack 将视频压缩为保留时序、运动和场景布局的潜在令牌,提示词则转化为指定应听到内容的语义令牌。一个潜在扩散 Transformer 在去噪音频时对两者进行交叉注意力处理,从而学习场景中应有什么声音以及何时发生。该方法旨在让生成的音频与画面内容及节奏精准同步。
AI模型PikaSoundtrack视频生成

推荐理由:Pika 发了 Soundtrack,能把视频压成潜在令牌再生成同步音频,时序和场景都对得上,做视频配乐可以试试。
原文
5月27日
06:32
06:32官方一手marktechpost@Asif Razzaq
76°
Stability AI 发布了 Stable Audio 3,一个用于乐器音乐和音效生成的潜在扩散模型家族。该版本包含小型和中等变体的开源权重。小型模型可在 MacBook Pro M4 CPU 上运行,中等模型适配 8GB VRAM 的消费级 GPU。两者均通过三阶段训练流程(流匹配、蒸馏预热、对抗后训练)生成 44.1 kHz 立体声音频。在 BBC 音效基准测试中,SA3 中等模型在 5 秒片段上取得 FAD 0.369 的分数,低于论文中评估的所有开源基线。
AI模型Stable Audio 3音频生成潜在扩散模型

推荐理由:Stable Audio 3 让音频生成门槛大幅降低——小型模型在普通笔记本上就能跑,做游戏音效、短视频配乐的创作者可以直接上手试试。
原文
精选全部日报登录