8月3日
12:08
12:08orange.ai@oran_ge
71°
MiniMax 将开源视频生成模型海螺 H3 的权重公开至 Hugging Face。据称该模型在生成效果上达到 Seedance 2.0 的约 80% 水准。作为开源视频生成模型,H3 目前处于 SOTA 级别,性能领先同类开源方案。
事件专题

推荐理由:MiniMax 把海螺 H3 开源了,效果据说有 Seedance 2.0 的八成,是目前开源视频模型里最强的,Hugging Face 上直接就能下载。
8月2日
20:10
20:10Hailuo AI@Hailuo_AI
Hailuo_AI转发了一条由用户aymiee创作的作品。该视频使用MiniMax H3模型,通过Pika MCP生成画面,并采用Google Flow生成音频,风格模仿自AIWarper。帖子目前获得6次点赞和802次观看。这个组合展示了MiniMax H3与第三方工具协作的潜力。
事件专题

推荐理由:这个视频用MiniMax H3加Pika MCP复刻了AIWarper那种风格,音频还是Google Flow做的,想试类似工作流可以学一手。
8月1日
02:11
02:11OpenRouter@OpenRouterAI
Runway 正式登陆 OpenRouter,首批提供 Aleph 2.0 和 Gen-4.5 两个模型。开发者通过同一套 API 既能编辑现有镜头,也能生成全新场景。这意味着原本需要分别调用编辑和生成接口的工作,现在可以统一在 OpenRouter 上完成。
推荐理由:Runway 把 Aleph 2.0 和 Gen-4.5 放到 OpenRouter 上了,现在能用同一个 API 剪片子和生成画面,不用再单独接两个平台,省事。
00:44
7月31日
23:02
23:02官方一手歸藏(guizang.ai)@op7418
MiniMax H3能根据分镜图或特效层参考生成复杂动态特效,支持全模态参考。用户用九宫格图片输入,总分辨率约1K,输出清晰度依然很高。文字和UI排版细节表现突出,适合广告片、MV、游戏宣传等场景。MiniMax官方确认该模型即将开源。
事件专题

推荐理由:MiniMax H3能根据分镜图和参考图直接生成复杂动效,文字细节很清晰,做广告片MV都合适,而且快开源了。
12:21
11:49
11:49官方账号arXiv cs.AI@Zexuan Yan, Yuzhou Wu, Yue Ma, Zonghang He, Kaibo Yin, Xiaobing Tu, Yinggui Wang, Jinkui Ren, Xiantao Zhang, Shijian Wang, Jinghong Liu, Linfeng Zhang
EgoGenesis是一个基于预训练视频生成先验的自我中心世界动作模拟器,用于合成可控的操作视频。它通过在线锚定投影记忆(OAPM)保留第一帧3D场景锚点,并用Action-3D RoPE编码末端执行器运动。将400条真实轨迹与400条EgoGenesis生成轨迹合并后,单臂任务真实机器人成功率从77%提升至84%。双臂任务成功率从53%提升至70%,说明合成数据能显著改善下游世界动作模型的泛化。
推荐理由:EgoGenesis是个能生成机器人操作视频的工具,用400条合成数据就把单臂成功率从77%提到84%,双臂从53%提到70%,挺厉害。
11:10
11:10OpenRouter@OpenRouterAI
MiniMax 发布开源权重视频模型 Hailuo H3,已上线 OpenRouter。H3 支持文本、图像、音频和视频四种输入,并输出原生音视频。官方定位包括指令驱动编辑、文字/品牌渲染和视频到视频的动作迁移。H3 主打轻量级,可直接在 OpenRouter 上调用。
推荐理由:开源视频模型 H3 上 OpenRouter 了,能按指令改视频、渲染品牌文字,还能视频到视频迁移动作,直接调用很方便。
10:48
10:48官方一手歸藏(guizang.ai)@op7418
精选
Seedance 2.5已在超创平台开放内测,支持一次生成30秒时长的视频。当前版本最高输出分辨率为720P。其全能参考功能允许一次上传最多50张图片作为生成依据。这些参数让该模型在长视频生成和多图参考方面具备明显优势。

推荐理由:Seedance 2.5内测来了,一次能生成30秒视频,还能传50张图做参考,感兴趣就去超创试试。
03:38
03:38Hailuo AI@Hailuo_AI
JPN GIRL在X上分享了一段使用MiniMax H3模型在Hailuo_AI平台制作的视频,内容涉及角色“パン子ちゃん”。该推文获得1014次浏览,1条回复,8个点赞。MiniMax H3是MiniMax推出的视频生成模型,支持用户快速创建角色动画。
事件专题

推荐理由:看看别人用MiniMax H3做的角色视频,效果挺有趣,能直观感受这个视频生成能力的实际表现。
01:45
01:45Hailuo AI@Hailuo_AI
MiniMax H3 模型成功替换了一个真实商业广告中的产品,所有演员、摄像机移动和阴影均保持原样。该演示由用户 Abdul Shakoor 分享,展示了模型对广告场景的高度还原能力。Hailuo_AI 官方转发了这一案例,引发广泛关注。
事件专题

推荐理由:每个广告公司都应该看看 MiniMax H3 怎么把真实广告里的产品替换掉,演员和镜头完全不变,太强了。
7月30日
11:09
11:09小互@imxiaohu
Magnific 发布了 38 页的全新提示词手册,核心观点是传统关键词式提示已失效。手册提出 AI 已进入推理(Reasoning)与导演对话时代,需要用明确的专业视觉语言指挥前沿模型。该手册针对当前主流图像和视频生成模型提供实用指南。

推荐理由:Magnific 出了本 38 页的提示词手册,教你用导演思维跟 AI 对话,不再堆关键词,适合想用好前沿图像视频模型的人。
7月29日
11:35
11:35官方账号arXiv cs.LG@Neta Shaul, Chao Liu, Arash Vahdat, Julius Berner
论文提出Parallel Decoding Distillation (PDD),一种基于轨迹的蒸馏方法,用于加速扩散模型和流匹配模型的推理。PDD兼容LTX-2.3 Text-to-Video/Audio、Wan 14B Text-to-Video和Qwen-Image Text-to-Image等预训练模型,支持4-8次函数评估。相比依赖变分分数蒸馏(VSD)和对抗损失的方法,PDD训练更简单,避免了模式坍塌,提升了生成视频的多样性。
推荐理由:这篇论文提出PDD方法,能用更少的采样步数生成高质量视频和图像,而且训练比VSD简单多了,适合搞生成加速的研究者看看。
11:10
11:10官方账号arXiv cs.AI@Carlos Celemin, Benedict Wilkins, Adrián Barahona-Ríos, Saman Zadtootaghaj, Nabajeet Barman
该研究探索了视觉语言模型(VLMs)在基于agent的游戏QA管道中检测几何裁剪异常。自定义探索agent收集视觉数据,自动标注管道提供帧级标签。零样本设置下测试了Gemini、GPT、Qwen、Gemma、Llama和Ministral六种VLM及四种提示变体。Gemini-3.1-Flash在总体准确率和提示鲁棒性上表现最佳,开源模型则对提示设计敏感。当前VLMs更适合作为多阶段QA管道中的高召回候选过滤器。
推荐理由:这篇论文用六种VLM检测游戏里的几何裁剪bug,发现Gemini最稳,开源模型要看怎么问提示词。想了解VLM实际落地坑点的可以看看。