#视频生成
Google 搞了个多智能体框架 Co-Director,专门解决 AI 视频长篇叙事前后不一致的问题,COLM 2026 现场有交互演示,做视频生成的可以去围观。
复旦、腾讯混元和浙大联合开源了 Prism,能生成 2K 分辨率且声音和画面同步对齐的视频,训练速度还快了 2.5 倍,做视频生成的可以去看看。
Kandinsky 6.0 Video 开源了,能从文字或图片生成 5 秒带音频和对口型的视频,vLLM-Omni 第一天就能跑,感兴趣可以试试。
一篇实用论文:MC-Sparse 不用训练就能把视频和 3D 生成的去噪提速 1.8 到 2.3 倍,还指出了以往稀疏注意力掉质量的三个原因。
有人拿 Opus 5.5 帮 Airbnb 房源做宣传视频,Seedance 2.5 出画面、ElevenLabs 配音,整套流程自动跑完,做民宿运营的可以抄作业。
一篇很巧的论文:让扩散模型在需要细节的地方用细 token、别处用粗 token,预训练模型不用重训就能提速,还能接智能体的规划布局。
fal、Bria AI、LTX 在 SF Tech Week 搞了场聚会,Google、Canva、ByteDance 这些做生成式视频图像的公司都来了人,想混圈的可以看看。
MiniMax 要去纽约广告周摆展位了,10月5到8号能现场看 H3 演示,还和 Krea、fal 聊圆桌,在附近的朋友可以去看。
HeyGen 团队做了个给 Agent 用的视频编辑器,描述一句就出初剪,画圈就能改,还能接 Claude Code,最后导 4K。
Krea 把 Agent 塞进了 After Effects,做动效、改视频比例、处理音频图片都能在剪辑软件里直接搞定,现在免费可试。
NVIDIA把PixelUMM开源了,一个模型搞定图文视频的理解和生成,做法是不用视觉编码器直接吃像素块,搞多模态研究的可以看看源码。
有人让 Claude 刷完 TikTok 后给它 200 美元做 MV,9 小时出了成片,流程值得拆开看看。
一条提示词就能让 Opus 5.5 做节拍同步的动态视频,配合 Suno v6 生成音乐,省下外包动态图形的钱,流程步骤都写清楚了。
AIGC 做的长剧真上电视了,花果山篇还拿下省级卫视收视第一,战天宫篇 10 月 4 日接着播,想看 AI 剧到底什么水准可以蹲一下。
快手 Kling AI 要去纽约广告周开专场了,还带着 Adobe 和 WPP 的人聊企业级视频生产,Kling 4.0 发布前值得蹲一下细节。
一家影视工作室自己训的视频模型,基于 MiniMax H3,一上榜就冲到带音频文生视频第二,导演直接参与训练反馈,思路挺特别。
生成媒体公司 fal 在旧金山办了 GenMedia Conference 2026,聊 AI 怎么降低拍片成本,还能聊聊 Pixar 的老故事。
MiniMax 去纽约广告周摆摊了,现场能玩 H3,还拉上 Krea 和 fal 聊生成工具,在附近可以去 booth A16E 看看。
Lovart 演示了一个挺好玩的工作流:先用 GPT Image 2.5 出图,再用 Seedance2.5 让文字像水一样流动起来,做视觉设计可以参考。