MiniMax H3能一次读文本、图、视频、音频,直接出带立体声的2K视频,最长15秒,试试看。
MiniMax发布新一代多模态生成模型MiniMax H3。该模型将文本、图像、视频、音频作为统一上下文处理,直接输出视频及原生立体声。H3支持2K分辨率,时长可在4至15秒之间选择,且仅支持整数时长。MiniMax称其不是简单的文生视频外加组件,而是通用多模态生成模型。
MiniMax Releases MiniMax H3: An Omni-Modal Video Model That Generates 15-Second 2K Clips With Native Stereo Audio
MiniMax releases MiniMax H3, a general-purpose multimodal generation model. MiniMax H3 is not a text-to-video model with add-ons. MiniMax describes it as a general-purpose multimodal generation model that reads text, images, video, and audio as one unified context and returns video with native stereo sound. The mains specs include: 2K output, 4–15 seconds, integer durations […] The post MiniMax Releases MiniMax H3: An Omni-Modal Video Model That Generates 15-Second 2K Clips With Native Stereo Audio appeared first on MarkTechPost .