8月21日
03:58
03:58官方账号Decoder@Matthias Bastian
Adobe 在 Firefly 中新增三款 AI 音频工具,包括 Generate Music、Generate Speech 和 Generate Sound Effects,用于生成视频项目所需的免版税音乐、旁白和音效。Adobe 还将 Google 的 Gemini Omni Flash 模型集成到其平台中。
事件专题

推荐理由:Adobe 给 Firefly 加了三个 AI 音频工具,能直接生成音乐、配音和音效。还接入了 Google 的 Gemini Omni Flash,比普通版更快。
8月20日
06:16
06:16官方账号Pika Labs@pika_labs
精选
皮卡实验室的Pika SFX在音频效果测试中表现最佳,该系统在内容实用性和生产质量两项指标上领先其他系统,这两项指标接近判断输出是否可用于创意工作流程的标准。

推荐理由:皮卡实验室发布了Pika SFX音频效果系统的测试结果,这个系统能做音频效果创作,和别的系统比起来它在实用性等方面表现更好,值得了解下~
8月19日
01:44
01:44官方账号Pika Labs@pika_labs
精选78°
Pika Audio发布了4款生成式音频模型。这些模型被定位为最实惠的音频模型之一,成本比其他模型低20倍。用户测试了Pika Soundtrack功能,将静音视频片段通过Pika生成音频并同步动作。
推荐理由:Pika刚发了4款音频生成模型,能把静音视频变有声,成本比其他低20倍,试试Pika Soundtrack。
8月17日
17:06
17:06量子位@思邈
该世界模型支持24FPS视频画面的实时生成。该模型还能以48kHz采样率输出立体声音频。这一24FPS与48kHz的组合,让世界模型具备了同步音画能力。官方宣布模型即将完全开源,开发者可获得24FPS视频与48kHz音频的生成能力。
推荐理由:这个新模型能同时生成24帧视频和48kHz立体声,比之前无声的世界模型多了一路声音,而且马上开源,可以自己跑一跑。
8月15日
06:50
04:49
04:49官方账号Pika Labs@pika_labs
70°
Pika Labs 今日发布 Pika Audio 模型,包含 4 个前沿基础模型,覆盖生成式声音全频谱。官方表示其定价比市场所有音频模型都低,最高便宜 20 倍。目前仅通过 X 平台公布,附带演示视频,技术细节尚未披露。
推荐理由:Pika 突然出了音频模型,4 个基础模型,还比市面便宜 20 倍,做视频的可以顺便看看。
8月6日
09:23
09:23官方账号arXiv cs.LG@Zehua Chen, Junyou Wang, Yuxuan Jiang, Zhenying Fang, Yusheng Dai, Jianfei Chen, Ziwei Liu, Jun Zhu
TD-V2A是一种基于扩散模型的视频到音频生成方法,利用时间差异作为区分视频与图像的关键表示。研究对比了帧级和特征级的时间差异,发现特征级更有效。该方法引入分层持续学习策略和退火时间差异引导,在基准数据集上取得优于对比音视频预训练的效果。
推荐理由:这篇论文提出用时间差异做视频生成音频,不用额外网络,效果还超过了对比预训练方法,值得做V2A的人看看。
8月3日
16:41
16:41idoubi@idoubicc
ShipAny 发布了名为 ShipAny Voice Agent 的模板。它通过对话加多步骤工具调用的方式生成和处理音频。用户后台配置 OpenAI、11labs 等厂商的 API key 即可开箱即用。该模板面向有声书、朗读、播客等音频场景。
事件专题

推荐理由:想做音频类 Agent 产品可以直接抄作业:ShipAny 出了 Voice Agent 模板,配上 OpenAI 或 11labs 的 key 就能跑,适合有声书和播客。
7月20日
16:08
16:08官方一手Pandaily@contact@pandaily.com (Pandaily)
76°
ByteDance Seed 团队发布 Seed Audio 1.0 音频生成模型,支持语音、音效和环境声的统一编排。该模型提供逐帧精度的时间轴控制,可精细调整每个音频元素的起止和混合。支持超过 20 种语言,面向电影级声音创作场景。
事件专题

推荐理由:字节跳动新出的 Seed Audio 1.0,能对音频做精确到帧的控制,做电影级音效、语音、环境声都行,还支持20多种语言。
14:45
14:45IT之家博客/媒体
72°
字节跳动 Seed 发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声。支持精细时间控制,一条 prompt 即可按时间线编排对白、音效和环境声。支持 20+ 语种生成,大部分语言 MOS 超 4 分,可用率在多数场景达 90% 以上。已在火山方舟体验中心上线。
事件专题

推荐理由:字节新出的 Seed Audio 1.0 能精细控制声音时间线,还能跨 20 多种语言保持音色一致,音频可用率超 90%,做视频创作很实用。
7月19日
14:52
7月15日
22:43
22:43Hailuo AI@Hailuo_AI
MiniMax Hub发布新版本,集成了ElevenLabs Music v2和Seed Audio 1.0两个音频模型。新版本还推出了一站式AI工作流,覆盖短剧制作、动态图形和高级摄像机控制。工作空间升级为智能模式,支持全局搜索和一键批量下载媒体。
推荐理由:MiniMax Hub这次更新很实在,加了两个新音频模型,还有针对短剧等场景的一站式工作流,工作空间也更方便了。
22:42
22:42Hailuo AI@Hailuo_AI
ElevenLabs推出Music v2,可从场景、风格和情绪提示生成任意类型音乐。Seed Audio 1.0支持从文本、参考音频或图像生成语音,并可调节速度、音量和音高。两个模型分别面向音乐和语音生成场景。

推荐理由:ElevenLabs同时更新了音乐和语音生成模型,Music v2能从提示生成任何风格音乐,Seed Audio 1.0支持图片转语音,玩法更多了。
6月15日
16:13