03:58官方账号Decoder@Matthias BastianAdobe 在 Firefly 中新增三款 AI 音频工具,包括 Generate Music、Generate Speech 和 Generate Sound Effects,用于生成视频项目所需的免版税音乐、旁白和音效。Adobe 还将 Google 的 Gemini Omni Flash 模型集成到其平台中。AI产品Adobe FireflyGemini Omni Flash音频生成1 个信源在谈事件专题推荐理由:Adobe 给 Firefly 加了三个 AI 音频工具,能直接生成音乐、配音和音效。还接入了 Google 的 Gemini Omni Flash,比普通版更快。原文稍后读已读值得跟进有用关注 Adobe Firefly
06:16官方账号Pika Labs@pika_labs精选Pika Labs推出的文本条件化扩散音频生成技术,采用44.1kHz立体声波形解码方式,将文本转化为高质量音频。该技术利用压缩声学潜在空间实现Transformer提示条件化,优化生成效率。通过流程匹配、教师–学生蒸馏及人类反馈训练,使生成过程缩短至少量优质步骤。AI模型Pika Labs音频生成多模态推荐理由:Pika Labs这技术能把文字快速转成带44.1kHz音质的音频,比以前方法少步骤还高效。原文稍后读已读值得跟进有用关注 Pika Labs
06:16官方账号Pika Labs@pika_labs精选皮卡实验室的Pika SFX在音频效果测试中表现最佳,该系统在内容实用性和生产质量两项指标上领先其他系统,这两项指标接近判断输出是否可用于创意工作流程的标准。AI模型Pika SFXPika Labs音频效果推荐理由:皮卡实验室发布了Pika SFX音频效果系统的测试结果,这个系统能做音频效果创作,和别的系统比起来它在实用性等方面表现更好,值得了解下~原文稍后读已读值得跟进有用关注 Pika SFX
05:55官方账号Pika Labs@pika_labsPika Soundtrack 将视频压缩为保留时序、运动和场景布局的潜在令牌,提示词则转化为指定应听到内容的语义令牌。一个潜在扩散 Transformer 在去噪音频时对两者进行交叉注意力处理,从而学习场景中应有什么声音以及何时发生。该方法旨在让生成的音频与画面内容及节奏精准同步。AI模型PikaSoundtrack视频生成推荐理由:Pika 发了 Soundtrack,能把视频压成潜在令牌再生成同步音频,时序和场景都对得上,做视频配乐可以试试。原文稍后读已读值得跟进有用关注 Pika
01:44官方账号Pika Labs@pika_labs精选78°Pika Audio发布了4款生成式音频模型。这些模型被定位为最实惠的音频模型之一,成本比其他模型低20倍。用户测试了Pika Soundtrack功能,将静音视频片段通过Pika生成音频并同步动作。AI产品PikaPika AudioPika Soundtrack推荐理由:Pika刚发了4款音频生成模型,能把静音视频变有声,成本比其他低20倍,试试Pika Soundtrack。原文稍后读已读值得跟进有用关注 Pika
17:06量子位@思邈该世界模型支持24FPS视频画面的实时生成。该模型还能以48kHz采样率输出立体声音频。这一24FPS与48kHz的组合,让世界模型具备了同步音画能力。官方宣布模型即将完全开源,开发者可获得24FPS视频与48kHz音频的生成能力。AI模型世界模型视频生成音频生成推荐理由:这个新模型能同时生成24帧视频和48kHz立体声,比之前无声的世界模型多了一路声音,而且马上开源,可以自己跑一跑。原文稍后读已读值得跟进有用关注 世界模型
10:08orange.ai@oran_gePika本次推出Pika Soundtrack、Pika Speech、Pika Music和Pika SFX四款音频生成模型。Pika Soundtrack支持上传视频自动配音、配乐和加音效,价格为同行一半。Pika Speech是文生音TTS模型,价格同样为同行一半。Pika Music文生音乐价格仅为同行的十分之一,Pika SFX文生音效价格仅为同行的二十分之一。AI模型Pika音频生成TTS推荐理由:Pika一口气发了4款音频模型,配音、语音、音乐、音效齐了,价格最低压到同行的1/20,做应用开发的可以去看看接不接。原文稍后读已读值得跟进有用关注 Pika
06:50官方账号Pika Labs@pika_labs精选Pika推出音频模型系列,涵盖Soundtrack、Music、SFX和Speech四种生成式声音模型,覆盖声音创作全谱系。官方称其推理技术使这些模型比市场上其他音频模型便宜最多20倍。Pika已在官网博客发布技术详解,介绍高效推理方法如何实现规模化下的音频质量。AI模型Pika音频生成Soundtrack推荐理由:Pika这次把音频模型价格打到市面最低,四款模型覆盖配乐、音乐、音效和语音,做内容的朋友可以留意下。原文稍后读已读值得跟进有用关注 Pika
04:49官方账号Pika Labs@pika_labs70°Pika Labs 今日发布 Pika Audio 模型,包含 4 个前沿基础模型,覆盖生成式声音全频谱。官方表示其定价比市场所有音频模型都低,最高便宜 20 倍。目前仅通过 X 平台公布,附带演示视频,技术细节尚未披露。AI模型PikaPika Audio音频生成推荐理由:Pika 突然出了音频模型,4 个基础模型,还比市面便宜 20 倍,做视频的可以顺便看看。原文稍后读已读值得跟进有用关注 Pika
04:48官方账号Pika Labs@pika_labs精选Pika 宣布音频模型全线降价,Soundtrack 定价 0.617/秒。该价格得益于训练与推理效率创新,成本效率是 Hunyuan Foley 的 2 倍。SFX 成本效率最高为同类方案的 20 倍。Speech 成本效率是 ElevenLabs v3 的 9 倍,Cartesia 与 ElevenLabs Turbo 的 4.5 倍。Music 成本效率比同类音乐模型最高可达 10 倍。AI产品PikaSoundtrack音频生成推荐理由:Pika 把音频生成价格打下来了,Soundtrack 每秒 0.617,性价比是 Hunyuan Foley 的两倍,做视频配音可以看看。原文稍后读已读值得跟进有用关注 Pika
09:23官方账号arXiv cs.LG@Zehua Chen, Junyou Wang, Yuxuan Jiang, Zhenying Fang, Yusheng Dai, Jianfei Chen, Ziwei Liu, Jun ZhuTD-V2A是一种基于扩散模型的视频到音频生成方法,利用时间差异作为区分视频与图像的关键表示。研究对比了帧级和特征级的时间差异,发现特征级更有效。该方法引入分层持续学习策略和退火时间差异引导,在基准数据集上取得优于对比音视频预训练的效果。论文TD-V2A视频生成音频生成推荐理由:这篇论文提出用时间差异做视频生成音频,不用额外网络,效果还超过了对比预训练方法,值得做V2A的人看看。原文稍后读已读值得跟进有用关注 TD-V2A
16:41idoubi@idoubiccShipAny 发布了名为 ShipAny Voice Agent 的模板。它通过对话加多步骤工具调用的方式生成和处理音频。用户后台配置 OpenAI、11labs 等厂商的 API key 即可开箱即用。该模板面向有声书、朗读、播客等音频场景。AI产品ShipAnyVoice AgentOpenAI10 个信源在谈事件专题推荐理由:想做音频类 Agent 产品可以直接抄作业:ShipAny 出了 Voice Agent 模板,配上 OpenAI 或 11labs 的 key 就能跑,适合有声书和播客。原文稍后读已读值得跟进有用关注 ShipAny
08:20岚叔@lufzzlizFLUX 3 在自家评测中生成10秒、720p带音频的文生视频,效果与Seedance 2.0打平。该模型支持单次最长20秒的视频生成,涵盖文生视频、图生视频、视频续写、关键帧控制及多语言对白。除媒体生成外,FLUX 3 的底层模型可扩展为机器人动作预测,输出机械臂控制指令。目前处于Early Access阶段,视频生成已开放申请,图像版本数周后推出。AI模型FLUX 3Seedance 2.0视频生成8 个信源在谈事件专题推荐理由:黑森林家的FLUX 3 刚曝光,既能文生视频又能带音效,还和Seedance 2.0打了个平手,甚至能控制机械臂。想尝鲜的可以去申请测试。原文稍后读已读值得跟进有用关注 FLUX 3
16:08官方一手Pandaily@contact@pandaily.com (Pandaily)76°ByteDance Seed 团队发布 Seed Audio 1.0 音频生成模型,支持语音、音效和环境声的统一编排。该模型提供逐帧精度的时间轴控制,可精细调整每个音频元素的起止和混合。支持超过 20 种语言,面向电影级声音创作场景。AI模型Seed Audio 1.0ByteDance音频生成1 个信源在谈事件专题推荐理由:字节跳动新出的 Seed Audio 1.0,能对音频做精确到帧的控制,做电影级音效、语音、环境声都行,还支持20多种语言。原文稍后读已读值得跟进有用关注 Seed Audio 1.0
14:45IT之家(博客/媒体)72°字节跳动 Seed 发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声。支持精细时间控制,一条 prompt 即可按时间线编排对白、音效和环境声。支持 20+ 语种生成,大部分语言 MOS 超 4 分,可用率在多数场景达 90% 以上。已在火山方舟体验中心上线。AI模型Seed Audio 1.0字节跳动火山方舟1 个信源在谈事件专题推荐理由:字节新出的 Seed Audio 1.0 能精细控制声音时间线,还能跨 20 多种语言保持音色一致,音频可用率超 90%,做视频创作很实用。原文稍后读已读值得跟进有用关注 Seed Audio 1.0
14:52官方账号Stability AI@StabilityAIStability AI 与 MusicHackspace 合作举办免费实践工作坊,教用户利用 Stable Audio 3.0 构建自定义音频应用和工作流。参与者可学习如何超越提示工程,实现生成式音频的深度集成。工作坊面向开发者和创作者,无需付费即可动手操作。技巧Stable AudioStabilityAIMusicHackspace推荐理由:想用 Stable Audio 3.0 做自己的音频工具?这个免费工作坊手把手教你搭建自定义应用,别错过。原文稍后读已读值得跟进有用关注 Stable Audio
09:46IT之家(博客/媒体)IT之家 7 月 17 日消息,阿里 ATH 事业群将推出 AI 音乐创作平台“HappyShrimp”(中文名“快乐虾米”)。该平台支持文本生成旋律、编曲、人声演唱,以及歌词生成、参考生成音频、风格迁移等功能。产品面向音乐创作者、制作人、自媒体博主等群体,计划推出 App 版本并在海外上线。阿里曾在 2013 年收购虾米音乐,后者于 2021 年 2 月 5 日停止服务。目前 HappyShrimp 尚未开放使用。AI产品阿里HappyShrimp虾米音乐推荐理由:阿里要推新的AI音乐平台HappyShrimp,一句话就能生成专属音乐,功能挺全,音乐创作者可以关注。原文稍后读已读值得跟进有用关注 阿里
22:43Hailuo AI@Hailuo_AIMiniMax Hub发布新版本,集成了ElevenLabs Music v2和Seed Audio 1.0两个音频模型。新版本还推出了一站式AI工作流,覆盖短剧制作、动态图形和高级摄像机控制。工作空间升级为智能模式,支持全局搜索和一键批量下载媒体。AI产品MiniMax HubElevenLabsSeed Audio推荐理由:MiniMax Hub这次更新很实在,加了两个新音频模型,还有针对短剧等场景的一站式工作流,工作空间也更方便了。原文稍后读已读值得跟进有用关注 MiniMax Hub
22:42Hailuo AI@Hailuo_AIElevenLabs推出Music v2,可从场景、风格和情绪提示生成任意类型音乐。Seed Audio 1.0支持从文本、参考音频或图像生成语音,并可调节速度、音量和音高。两个模型分别面向音乐和语音生成场景。AI模型ElevenLabsMusic v2Seed Audio 1.0推荐理由:ElevenLabs同时更新了音乐和语音生成模型,Music v2能从提示生成任何风格音乐,Seed Audio 1.0支持图片转语音,玩法更多了。原文稍后读已读值得跟进有用关注 ElevenLabs
09:45IT之家(博客/媒体)71°火山引擎发布豆包音频生成模型1.0(Doubao-Seed-Audio 1.0),首次支持将文本、音频等多模态输入端到端生成目标音频。该模型能在长时生成中保持多角色音色一致性,减少后期修音工作。单条Prompt可编排角色对白、情绪语气、背景音乐等,直接产出完整音频作品。火山方舟已开启API邀测,个人用户可体验30分钟创作额度。AI模型豆包音频生成模型1.0火山引擎音频生成5 个信源在谈事件专题推荐理由:火山引擎新模型能一次编排对白、音效、配乐,还能保持10分钟的角色音色一致,省掉后期对轨修音,音频创作者值得一试。原文稍后读已读值得跟进有用关注 豆包音频生成模型1.0
15:02orange.ai@oran_geListenHub 创始人宣布即将接入字节跳动的 Seed Audio 模型。该模型能够用声音智能创造有趣且有用的内容。团队在去年创建 ListenHub 时就期待这样的能力。接入后用户可在 ListenHub 上获得全新的音频内容制作体验。官网 listenhub.ai 已发布上线信息。AI产品Seed AudioListenHub音频生成2 个信源在谈事件专题推荐理由:做音频内容的朋友注意了,ListenHub 要接入字节的 Seed Audio 了,以后做播客、配音这些会方便很多。原文稍后读已读值得跟进有用关注 Seed Audio
14:48orange.ai@oran_ge豆包音频生成模型 Seed Audio 1.0 发布,可根据想象生成人声、音乐、音效和环境音。与传统的 TTS(仅文本转语音)不同,它能捕捉声音中的微妙细节。这是首次将智能赋予声音的模型,类似图像领域的 Seedance 时刻。AI产品豆包Seed Audio 1.0音频生成3 个信源在谈事件专题推荐理由:豆包发了 Seed Audio 1.0,不光能念稿,还能生成音乐和音效,像声音版的 DALL·E,值得听听。原文稍后读已读值得跟进有用关注 豆包
16:13量子位@思邈Noiz AI联合香港科技大学和清华大学开源了一款音频生成大模型。该模型仅需4步推理即可生成高质量音频,在单张GPU上推理速度达到0.24秒。其高效架构显著降低了音频生成的计算门槛。开源代码和模型权重已在GitHub发布,支持多种音频生成任务。AI模型音频生成开源模型Noiz AI推荐理由:噪点AI和港科大、清华联手做了一个音频模型,4步生成只要0.24秒,比同类快很多,还开源了,想玩音频AI的可以试试。原文稍后读已读值得跟进有用关注 音频生成
06:32官方一手marktechpost@Asif Razzaq76°Stability AI 发布了 Stable Audio 3,一个用于乐器音乐和音效生成的潜在扩散模型家族。该版本包含小型和中等变体的开源权重。小型模型可在 MacBook Pro M4 CPU 上运行,中等模型适配 8GB VRAM 的消费级 GPU。两者均通过三阶段训练流程(流匹配、蒸馏预热、对抗后训练)生成 44.1 kHz 立体声音频。在 BBC 音效基准测试中,SA3 中等模型在 5 秒片段上取得 FAD 0.369 的分数,低于论文中评估的所有开源基线。AI模型Stable Audio 3音频生成潜在扩散模型推荐理由:Stable Audio 3 让音频生成门槛大幅降低——小型模型在普通笔记本上就能跑,做游戏音效、短视频配乐的创作者可以直接上手试试。原文稍后读已读值得跟进有用关注 Stable Audio 3
13:27官方账号Stability AI@StabilityAIStability AI 推出了 Stable Audio 3.0,这是一个开源权重模型系列,专为艺术实验设计。新版本支持最长六分钟的变长音频生成,并能在便携设备上完成完整歌曲创作,无需 GPU。模型基于完全许可的数据集训练,用户可商用输出,年收入不超过 100 万美元。首次支持 LoRa 训练,允许用户用自己的音频库定制模型。Stability AI 邀请开发者参与实验,认为最佳创新仍在等待被构建。AI模型Stable Audio 3.0开源/仓库音频生成推荐理由:音乐创作者和 AI 音频开发者终于有了一个可商用、可定制的开源音频模型——Stable Audio 3.0 支持六分钟生成和 LoRa 微调,做音乐生成或声音设计的团队可以直接上手实验。原文稍后读已读值得跟进有用关注 Stable Audio 3.0
23:47IT之家(博客/媒体)76°Stability AI 发布全新音频生成模型家族 Stability Audio 3.0,包含四款不同参数规模的模型,其中大型版可生成长达 6 分 20 秒的完整乐曲,相比 2.0 版翻倍。小型模型专注于设备端运行,可本地生成两分钟以内的声音与音乐。Stability AI 已将小型 SFX、小型及中型模型开源,大型模型仅通过 API 和付费托管服务提供。该公司已与华纳音乐集团、环球音乐集团达成合作,确保训练数据合法授权,并正为专业音乐人打造新产品线。AI产品音频生成开源/仓库Stability AI推荐理由:音乐创作者和音频开发者终于有了能生成完整歌曲的开源模型——Stability Audio 3.0 的中型版已开源,长度翻倍且结构可控,做音乐生成或音频工具的建议直接下载试试。原文稍后读已读值得跟进有用关注 音频生成
12:58IT之家(博客/媒体)AI 音乐生成应用 Suno 正式登陆苹果 CarPlay,用户可在驾驶时播放自己通过文字提示生成的曲目。CarPlay 界面分为资料库和探索区,方便管理个人创作和发现他人作品。同时上线的还有聚合传统电台和播客的 Zeno Radio。这标志着 AI 生成内容开始融入车载场景,为驾驶者提供更个性化的音频体验。AI产品SunoAI 音乐CarPlay推荐理由:Suno 让 AI 音乐创作进入驾车场景,喜欢在车里听歌或想尝试 AI 音乐生成的车主可以直接在 CarPlay 上体验,不用再依赖手机操作。原文稍后读已读值得跟进有用关注 Suno