8月6日
09:23
09:23官方账号arXiv cs.LG@Zehua Chen, Junyou Wang, Yuxuan Jiang, Zhenying Fang, Yusheng Dai, Jianfei Chen, Ziwei Liu, Jun Zhu
TD-V2A是一种基于扩散模型的视频到音频生成方法,利用时间差异作为区分视频与图像的关键表示。研究对比了帧级和特征级的时间差异,发现特征级更有效。该方法引入分层持续学习策略和退火时间差异引导,在基准数据集上取得优于对比音视频预训练的效果。
推荐理由:这篇论文提出用时间差异做视频生成音频,不用额外网络,效果还超过了对比预训练方法,值得做V2A的人看看。
8月5日
21:38
21:38官方账号Decoder@Matthias Bastian
Black Forest Labs推出FLUX 3 Video,能生成最长20秒的全高清视频,并自带原生音频和唇形同步对话,支持超过14种语言。该模型还能直接在场景中渲染文字。BFL公布的Elo排行榜显示,FLUX 3 Video的评分高于Gemini Omni Flash和Seedance 2.0。
事件专题

推荐理由:Black Forest Labs出了FLUX 3 Video,能生成20秒带原生声音和口型对上的视频,还说自己比Seedance 2.0强,去看看效果吧。
16:51
04:07
04:07官方账号Simon Willison@simonw
MiniMax-H3 视频生成模型在 M5 Pro Mac 上运行,生成耗时约 45 分钟。模型下载大小约 115GB。测试提示词为“一只彩虹色的臭鼬跳过超市里长满苔藓的原木”。Simon Willison 在推文中分享了这一结果。
事件专题

推荐理由:Simon 用 M5 Pro Mac 跑 MiniMax-H3,下载 115GB 后花 45 分钟生成了彩虹臭鼬视频,效果挺有趣。
03:29
03:29官方账号Pika Labs@pika_labs
Pika Labs 推出 API Club,通过单一 API 接入超过100个主流生成式媒体模型,覆盖视频、图像、音频和 LLM。所有模型价格均公开透明,官网列出每个模型与竞品的详细对比。即使 API Club 偶尔定价更高,也会明确标示,方便开发者直接比较。
推荐理由:Pika 搞了个 API Club,一个接口就能调上百个视频、图像、音频和语言模型,价格还全透明,方便比价。
03:16
03:16OpenRouter@OpenRouterAI
Black Forest Labs 的 FLUX 3 Video 现已面向所有用户开放,可通过 OpenRouter 平台调用。该模型采用统一架构联合训练,支持视频、音频、图像和动作预测四类任务。官方称其兼顾写实、创意与电影感,适合多种创作场景。
事件专题

推荐理由:黑森林家的 FLUX 3 Video 上 OpenRouter 了,一个模型能生成视频、音频、图像还能做动作预测,想试试直接调 API 就行。
03:16
8月4日
12:41
12:33
07:36
07:36lmarena.ai@lmarena_ai
在LMSYS Text-to-Video Arena排行榜中,MiniMax-H3获得1455分,与Muse Video的1458分仅差3分,并列总榜第三。Hailuo-2.3以1260分排在第23位,Hailuo-02-pro以1228分排在第29位。MiniMax-H3比排名紧随其后的最佳开源模型高出283分,表现亮眼。
事件专题

推荐理由:MiniMax-H3这回冲到了视频生成基准第三,离Muse Video就差3分,还比其它开源模型高出一大截,值得看看。
8月3日
23:06
23:06小互@imxiaohu
字节跳动为视频生成模型Seedance 2.5发布两份官方文档,分别是提示词指南和用户指南。提示词指南讲解如何撰写提示词,用户指南介绍从输入到生成的完整流程。两份文档已托管在Lark文档平台,可直接访问使用。
事件专题

推荐理由:字节跳动给Seedance 2.5出了官方提示词指南和用户手册,视频创作者照着写提示词就行,比看零散教程靠谱。
20:40
20:40官方账号快手可灵 Kling@Kling_AI
Kling MCP 提供了一套面向美食品牌的完整视频制作流程,涵盖创意风格分析、故事板构建和最终视频生成。教程演示了如何利用 AI 批量产出促销视频,提升内容生产效率。该流程适用于社交媒体短视频场景,帮助餐饮商家快速建立视觉内容。
推荐理由:Kling MCP 出了个新教程,手把手教你从分析风格到生成视频,批量做美食促销宣传片,餐饮号运营可以看看。
19:14
19:14Hailuo AI@Hailuo_AI
HailuoAI MiniMax H3 视频生成模型在文字渲染上表现精准。H3 能把教学设想转成提示词,直接生成学习视频。原本需要整支制作团队的工作,现在用 H3 单独就能完成。H3 的这一能力让教育视频制作门槛大幅降低。
事件专题

推荐理由:H3 文字渲染是真的稳,想拿 AI 做教学视频的话,直接把教案写成提示词就能生成,比想象中省事。
15:59
15:59官方一手pandaily@contact@pandaily.com (Pandaily)
MiniMax 在 HuggingFace 上开源 H3-Base 权重,采用 33B 参数的稠密单流 Omni-Transformer 架构。该模型配备 16 倍空间和 4 倍时间压缩 VAE,本地运行只需两张 RTX 5090 显卡。其 API 定价仅为 Seedance 2.0 的三分之一。H3 在基准测试中直接对标 Seedance 2.0,展示了开源视频生成模型的竞争力。

推荐理由:MiniMax 把 H3 开源了,33B 参数,两张 RTX 5090 就能本地跑,API 价格只有 Seedance 2.0 的三分之一,想玩视频生成的可以试试。
12:42
12:08
12:08orange.ai@oran_ge
71°
MiniMax 将开源视频生成模型海螺 H3 的权重公开至 Hugging Face。据称该模型在生成效果上达到 Seedance 2.0 的约 80% 水准。作为开源视频生成模型,H3 目前处于 SOTA 级别,性能领先同类开源方案。
事件专题

推荐理由:MiniMax 把海螺 H3 开源了,效果据说有 Seedance 2.0 的八成,是目前开源视频模型里最强的,Hugging Face 上直接就能下载。