Runway 出了 Gen-4.5,视频生成更听指令了,还能保持前后镜头一致,现在 OpenRouter 上就能直接调。
#视频生成
MiniMax H3 8 月 3 日开源,能做 15 秒 2K 音视频,价格只有主流模型的 1/3,看看合不合用。
Cia0用MiniMax H3加Midjourney V8.2做了个动画版UI作品集,H3能一次生成音频、文字和角色锁定,比SD2省事多了。
EgoGenesis是个能生成机器人操作视频的工具,用400条合成数据就把单臂成功率从77%提到84%,双臂从53%提到70%,挺厉害。
Vercel 把 MiniMax H3 接进 AI Gateway 了,用 generateVideo 写个提示词就能生成 8-bit 动画,想玩视频生成的可以试试。
有人拿 Suno 做歌,再用 MiniMaxH3 生成机器人对口型,嘴型准到离谱,还给了 sref 参数,想试的可以直接抄作业。
这篇论文揭示了视频世界模型长视频生成不稳定的根本原因——表示维度塌缩,并提出了一个简单有效的正则化方法,在VBench上大幅超过Diffusion Forcing。
这篇论文用六种VLM检测游戏里的几何裁剪bug,发现Gemini最稳,开源模型要看怎么问提示词。想了解VLM实际落地坑点的可以看看。
想知道AI拍电影多快?Blomkamp用Seedance 2.0两周就搞出13分钟科幻片,还用了32个真人演员,值得看看。
Vivix这个新模型单卡就能每秒生成上万视频token,做实时互动视频、多模态聊天特别带劲,比之前那些慢吞吞的方案强多了。
想省掉学一堆视频工具?用 Claude Code 或 Codex 加上 Topview MCP 服务器,就能在 Amazon、TikTok 等平台一键做广告视频,快试试。
Black Forest Labs的Flux 3能生成带声音的视频,最长20秒,性能还略超Seedance 2.0,他们想搞世界模型,值得关注。