12:08orange.ai@oran_ge71°MiniMax 将开源视频生成模型海螺 H3 的权重公开至 Hugging Face。据称该模型在生成效果上达到 Seedance 2.0 的约 80% 水准。作为开源视频生成模型,H3 目前处于 SOTA 级别,性能领先同类开源方案。AI模型MiniMax-H3Seedance视频生成7 个信源在谈事件专题推荐理由:MiniMax 把海螺 H3 开源了,效果据说有 Seedance 2.0 的八成,是目前开源视频模型里最强的,Hugging Face 上直接就能下载。原文稍后读已读值得跟进有用关注 MiniMax-H3
10:57IT之家(博客/媒体)MiniMax 于 8 月 3 日开源新一代通用视频模型 H3,支持文本、图像、视频、音频统一理解与生成。H3 可输出最高 2K 分辨率、15 秒时长、32kHz 立体声音频的视频,帧率为 24 FPS。其输入规格包含 H3-Base-FL2VA 首尾帧模式和 H3-Base-Ref2VA 全模态参考模式,后者最多支持 9 张图像与 3 段视频。H3 稳定支持中英阿法等 11 种语言,完整系统由 H3-Context-IR、H3-Base 和 H3-Regenerate-2K 三模块组成。AI模型MiniMaxH3视频生成推荐理由:MiniMax 把能处理多模态上下文的视频模型直接开源了,最长生成 15 秒 2K 带立体声的视频,比一般文生视频强在能看懂图片、音频和视频混合输入。原文稍后读已读值得跟进有用关注 MiniMax
10:47SuperTechFans(博客/媒体)字节跳动发布新一代视频生成模型 Seedance 2.5,单次可生成最长 30 秒视频。Seedance 2.5 支持多模态引用,可参考图片和视频素材进行创作。该模型还提供高级编辑功能,方便用户调整生成内容。目前 Seedance 2.5 已上线多个平台,官方表示 API 即将推出。AI模型Seedance 2.5字节跳动视频生成3 个信源在谈事件专题推荐理由:字节跳动发布了 Seedance 2.5,一次能生成 30 秒视频,还能参考多模态素材,API 也快出了。原文稍后读已读值得跟进有用关注 Seedance 2.5
22:08Hailuo AI@Hailuo_AIMiniMax H3 在用户 Farhan 的测试中生成了完整的游戏风格电影片段,场景包含古代水神庙、发光神器、巨石守卫和逃跑序列。整个片段中角色外观、镜头运动、水面光照、动作和音频保持了跨镜头一致,没有出现角色突变或环境崩坏。Farhan 认为它虽有小瑕疵,但已比随机生成的 AI 片段更接近真正的游戏过场动画。AI模型MiniMax H3Hailuo AI视频生成7 个信源在谈事件专题推荐理由:Farhan 用 MiniMax H3 做了一段水神庙逃生的游戏过场,角色、镜头、音效全程没崩,比单图生成靠谱多了。原文稍后读已读值得跟进有用关注 MiniMax H3
20:10Hailuo AI@Hailuo_AIHailuo_AI转发了一条由用户aymiee创作的作品。该视频使用MiniMax H3模型,通过Pika MCP生成画面,并采用Google Flow生成音频,风格模仿自AIWarper。帖子目前获得6次点赞和802次观看。这个组合展示了MiniMax H3与第三方工具协作的潜力。技巧MiniMax H3Pika MCPGoogle Flow7 个信源在谈事件专题推荐理由:这个视频用MiniMax H3加Pika MCP复刻了AIWarper那种风格,音频还是Google Flow做的,想试类似工作流可以学一手。原文稍后读已读值得跟进有用关注 MiniMax H3
00:08Hailuo AI@Hailuo_AI视频创作者@mxvdxn在X平台表示,MiniMax H3成为其短剧系列BAD GOLD得以继续的关键。此前他因Seedance 2.0的生成成本过高,几乎放弃该系列。他称MiniMax H3通常第二次尝试就能达到预期对话效果,对语言细微差别的理解非常出色。相比Seedance 2.0,该模型价格更亲民,特别适合以对话驱动的微短剧创作。他还计划在特定动作场景中结合Seedance 2.5使用。AI产品MiniMax H3海螺AI视频生成7 个信源在谈事件专题推荐理由:MiniMax H3便宜好用,对白理解强,比Seedance 2.0省钱,做短剧的创作者说系列能续上了。原文稍后读已读值得跟进有用关注 MiniMax H3
21:56官方账号Decoder@Gregor Kobsik72°字节跳动发布AI视频模型Seedance 2.5,可同时生成视频与音频。单段片段最长30秒,是谷歌Gemini Omni Flash输出时长的三倍。用户可输入数十张图片、视频和音频文件作为参考。对广告团队而言,这省去了逐段拼接短片的流程。AI模型Seedance 2.5ByteDance视频生成1 个信源在谈事件专题推荐理由:字节Seedance2.5生成30秒带声视频,是Gemini Omni Flash的三倍,广告剪辑省事。原文稍后读已读值得跟进有用关注 Seedance 2.5
16:33官方一手marktechpost@Asif RazzaqMiniMax发布新一代多模态生成模型MiniMax H3。该模型将文本、图像、视频、音频作为统一上下文处理,直接输出视频及原生立体声。H3支持2K分辨率,时长可在4至15秒之间选择,且仅支持整数时长。MiniMax称其不是简单的文生视频外加组件,而是通用多模态生成模型。AI模型MiniMax H3MiniMax视频生成7 个信源在谈事件专题推荐理由:MiniMax H3能一次读文本、图、视频、音频,直接出带立体声的2K视频,最长15秒,试试看。原文稍后读已读值得跟进有用关注 MiniMax H3
10:53Justine Moore@venturetwins一位用户过去一年半用同一图灵测试提示词试遍了 AI 视频模型,无一成功。MiniMax 3 成为首个通过该测试的模型,能在黑板上写出"Hi"。该模型由 Hailuo AI 团队发布,已开源。这标志着视频生成模型在指令遵循和文字书写能力上的显著进展。AI模型MiniMax 3Hailuo AI视频生成推荐理由:MiniMax 3 居然能真在黑板上写 Hi,之前所有视频模型都做不到,还开源了,快去试试。原文稍后读已读值得跟进有用关注 MiniMax 3
02:11OpenRouter@OpenRouterAIRunway 正式登陆 OpenRouter,首批提供 Aleph 2.0 和 Gen-4.5 两个模型。开发者通过同一套 API 既能编辑现有镜头,也能生成全新场景。这意味着原本需要分别调用编辑和生成接口的工作,现在可以统一在 OpenRouter 上完成。AI产品RunwayOpenRouterAleph 2.0推荐理由:Runway 把 Aleph 2.0 和 Gen-4.5 放到 OpenRouter 上了,现在能用同一个 API 剪片子和生成画面,不用再单独接两个平台,省事。原文稍后读已读值得跟进有用关注 Runway
02:10OpenRouter@OpenRouterAIRunway推出视频生成模型Gen-4.5,主打可控性、电影感和跨镜头一致性。该模型强调精确遵循用户提示,并支持多种生成模式下的高级运动质量。开发者可通过OpenRouter平台直接调用Gen-4.5。官方示例展示了其在保持角色和场景连贯方面的能力。AI模型RunwayGen-4.5OpenRouter推荐理由:Runway 出了 Gen-4.5,视频生成更听指令了,还能保持前后镜头一致,现在 OpenRouter 上就能直接调。原文稍后读已读值得跟进有用关注 Runway
00:44Hailuo AI@Hailuo_AIHailuo AI展示Minimax 3的精准口型同步能力。用户Kyle Coghlan转发并称赞其效果,认为音乐视频创作将因此改变。该功能支持输入包含4段文字的参考图像,配合快速剪辑生成同步视频。AI产品Minimax 3Hailuo AI视频生成推荐理由:Hailuo AI的Minimax 3对口型超准,放一张带四段文字的参考图就能让角色唱歌,做音乐视频的可以试试。原文稍后读已读值得跟进有用关注 Minimax 3
23:02官方一手歸藏(guizang.ai)@op7418MiniMax H3能根据分镜图或特效层参考生成复杂动态特效,支持全模态参考。用户用九宫格图片输入,总分辨率约1K,输出清晰度依然很高。文字和UI排版细节表现突出,适合广告片、MV、游戏宣传等场景。MiniMax官方确认该模型即将开源。技巧MiniMax H3视频生成特效5 个信源在谈事件专题推荐理由:MiniMax H3能根据分镜图和参考图直接生成复杂动效,文字细节很清晰,做广告片MV都合适,而且快开源了。原文稍后读已读值得跟进有用关注 MiniMax H3
22:44小互@imxiaohuSeedance 2.5正式发布,单次生成视频最长可达30秒。模型最多支持50个参考素材输入,角色、道具、风格等可一次性提供。官方演示显示,镜头运用、特效与人物表现均为电影级,且一次生成、无分段拼接。Seedance 2.5即将登陆Higgsfield平台,该平台目前提供Seedance 2.0的4K无限量使用。AI模型SeedanceHiggsfield视频生成推荐理由:Seedance 2.5来了,一次生成30秒电影感视频,还能塞50个参考素材,等它上Higgsfield就能玩。原文稍后读已读值得跟进有用关注 Seedance
21:17IT之家(博客/媒体)稀宇科技宣布 MiniMax H3 通用多模态视频模型将于北京时间 8 月 3 日 0 点在魔搭社区开源。该模型支持文本、图像、视频、声音组成的多模态上下文统一理解,可输出带原生双声道的音视频,最高支持 15 秒 2K 分辨率。官方称其默认提供 2K 分辨率,每秒价格不到主流模型的 1/3,768P 分辨率下价格为主流模型 720P 的 1/2。AI模型MiniMaxH3视频生成推荐理由:MiniMax H3 8 月 3 日开源,能做 15 秒 2K 音视频,价格只有主流模型的 1/3,看看合不合用。原文稍后读已读值得跟进有用关注 MiniMax
19:39Hailuo AI@Hailuo_AI海螺AI官方分享了一段MiniMax H3生成的短视频,主打精准唇形同步。该片段来自用户Aaliya的第二次测试,提示词设定为16:9夜间武侠竹林。画面要求低饱和度冷蓝、墨绿、炭灰配色,并加入浅景深、面部特写等电影化细节。生成结果无字幕、无现代元素,强调拟真影视质感。AI模型MiniMax H3Hailuo AI视频生成5 个信源在谈事件专题推荐理由:MiniMax H3在海螺AI上对口型很准,一段提示词就能生成古风武侠片段,效果自然。原文稍后读已读值得跟进有用关注 MiniMax H3
16:45Hailuo AI@Hailuo_AI设计师Cia0用MiniMax H3和Midjourney V8.2制作了一个动画UI/UX作品集网站。页面采用十二栏网格布局,左侧五栏留白给主标题,光环动画作为加载器。MiniMax H3在一次生成中同时处理原生音频、屏幕文字和角色锁定,作者认为这一组合比SD2更有优势。整个制作使用了4,367个字符的中文提示词。AI模型MiniMax H3Midjourney视频生成5 个信源在谈事件专题推荐理由:Cia0用MiniMax H3加Midjourney V8.2做了个动画版UI作品集,H3能一次生成音频、文字和角色锁定,比SD2省事多了。原文稍后读已读值得跟进有用关注 MiniMax H3
15:44LovartAI@lovart_aiMiniMax H3 已上线视频平台 Lovart,官方称其为全球排名第二的视频模型。该模型可生成15秒电影级视频,具有流畅且高保真的运动表现。它支持文本、图像、视频和音频四种多模态参考输入,并保持角色、产品、场景和风格的一致性。官方表示,其生产成本低于同类方案的一半,适用于广告、MV 和 TVC 制作。AI模型MiniMaxH3Lovart推荐理由:MiniMax H3 上了 Lovart,15秒电影级视频,成本还不到一半,做广告片和MV的可以试试。原文稍后读已读值得跟进有用关注 MiniMax
15:09IT之家(博客/媒体)字节跳动 7 月 31 日发布新一代视频生成模型 Seedance 2.5,火山引擎近期将上线 API 服务。徐工集团、小鹏汽车、智元机器人、灵初智能等多家企业已达成合作意向,率先接入该模型。Seedance 2.5 新增白模参考能力,可将白模素材渲染为写实汽车拼装片段。小鹏汽车将其集成至内部 AI 设计平台,穹彻智能用它扩充具身智能大模型训练数据。多家智驾企业正探索用 Seedance 生成暴雨、大雾、降雪等极限工况训练数据。AI模型Seedance火山引擎字节跳动2 个信源在谈事件专题推荐理由:字节的 Seedance 2.5 来了,徐工、小鹏、智元都要用。能生成工业培训和智驾极限场景视频,还支持白模转写实。原文稍后读已读值得跟进有用关注 Seedance
13:39Hailuo AI@Hailuo_AIHailuo AI官方转发了一条玩家示范:用Hailuo AI生成长约15秒的“Deck-Builder Turn”等距战术肉鸽游戏视频。提示词先用两张参考图固定棋盘和UI风格,再按0-2秒、2-5秒、5-8秒、8-11秒、11-15秒分段描述运镜、卡牌发牌、能量增减和敌方回合。要求UI始终贴紧屏幕、文字清晰拼写正确,并给出负向提示词防止UI漂移和血腥。官方标签提到MiniMax H3,适合想研究视频生成分镜控制的人参考。技巧Hailuo AIMiniMax H3视频生成5 个信源在谈事件专题推荐理由:一条现成的15秒游戏UI视频提示词,把镜头、卡牌动作和音效都安排好了,想玩Hailuo AI直接抄作业。原文稍后读已读值得跟进有用关注 Hailuo AI
12:49IT之家(博客/媒体)字节跳动7月31日发布Seedance 2.5视频生成模型,单次生成时长从15秒提升到30秒,并支持多轮延长。模型延续Seedance 2.0统一的多模态音视频联合生成架构,可一次输入最多30张图片、10段视频、10段音频作为参考。官方示例展示了30秒音乐会片段,能同时还原多个人物形象与声音。Seedance 2.5将陆续上线即梦AI与豆包专业版,API服务近期接入火山方舟。模型面向影视、广告、教育、具身智能和自动驾驶等场景。AI模型Seedance字节跳动即梦AI推荐理由:字节新模型一次能生成30秒连贯视频,还能多轮延长,做短片不用一段段拼了,影视剪辑党可以试试。原文稍后读已读值得跟进有用关注 Seedance
12:29Hailuo AI@Hailuo_AIMiniMax H3 在 Artificial Analysis 视频编辑排行榜位列第一,文本转视频排名第二,图像转视频排名第三。该模型支持输入文本、图像、视频和音频,生成 5-15 秒 24fps 带原生音频的片段,2K 视频定价为每秒 0.13 美元(每分钟 7.80 美元)。其价格低于 Dreamina Seedance 2.0 的每分钟 22.45 美元、HappyHorse-1.1 的 9.90 美元和 Kling 3.0 的 20.16 美元,但高于 Google Gemini Omni Flash 的 6.00 美元。MiniMax 计划以社区许可发布权重,营收低于 2000 万美元的组织可商用,需显著署名。当前该模型已在 Hailuo AI app 和 MiniMax API 提供。AI模型MiniMax H3HailuoArtificial Analysis5 个信源在谈事件专题推荐理由:视频编辑直接登顶的 MiniMax H3,带原生音频,价格不到 Kling 的一半,还说要开源权重,做视频的可以试试。原文稍后读已读值得跟进有用关注 MiniMax H3
12:21lmarena.ai@lmarena_aiMiniMax H3已加入LMSYS视频竞技场,支持文本转视频和图像转视频两种模式,用户可参与投票评测。该模型主打全参考(Omni-Reference)能力、商业级生成效果和性价比,并承诺将开放权重。MiniMax H3现已在HailuoAI.video和MiniMax API上线,基准评分即将公布。AI模型MiniMaxH3HailuoAI推荐理由:MiniMax发了新视频模型H3,能文生视频也能图生视频,你可以在竞技场里直接投票试玩,效果和开源都值得关注。原文稍后读已读值得跟进有用关注 MiniMax
11:49官方账号arXiv cs.AI@Zexuan Yan, Yuzhou Wu, Yue Ma, Zonghang He, Kaibo Yin, Xiaobing Tu, Yinggui Wang, Jinkui Ren, Xiantao Zhang, Shijian Wang, Jinghong Liu, Linfeng ZhangEgoGenesis是一个基于预训练视频生成先验的自我中心世界动作模拟器,用于合成可控的操作视频。它通过在线锚定投影记忆(OAPM)保留第一帧3D场景锚点,并用Action-3D RoPE编码末端执行器运动。将400条真实轨迹与400条EgoGenesis生成轨迹合并后,单臂任务真实机器人成功率从77%提升至84%。双臂任务成功率从53%提升至70%,说明合成数据能显著改善下游世界动作模型的泛化。论文EgoGenesis视频生成具身智能推荐理由:EgoGenesis是个能生成机器人操作视频的工具,用400条合成数据就把单臂成功率从77%提到84%,双臂从53%提到70%,挺厉害。原文稍后读已读值得跟进有用关注 EgoGenesis
11:44Guillermo Rauch@rauchgVercel 在推文中宣布,MiniMax H3 现在可以通过其 AI Gateway 使用。开发者调用 generateVideo 方法并传入模型参数 minimax/minimax-h3 即可生成视频。示例提示词为“8-bit, black and white animation of san francisco”,演示了该模型的 8-bit 黑白动画能力。这次集成让多模型调用和切换变得更简单。AI产品MiniMax H3Vercel AI Gateway视频生成5 个信源在谈事件专题推荐理由:Vercel 把 MiniMax H3 接进 AI Gateway 了,用 generateVideo 写个提示词就能生成 8-bit 动画,想玩视频生成的可以试试。原文稍后读已读值得跟进有用关注 MiniMax H3
11:41Hailuo AI@Hailuo_AIHailuo AI 的 MiniMaxH3 模型在一次演示中展现出精准的机器人唇形同步能力。用户 Mac Lotze 用 AI 音乐工具 Suno 生成曲目后,将唇形同步任务交给 MiniMaxH3,称其提示词连贯性和嘴型匹配都相当理想。他公开了制作时使用的风格参考参数 --sref 2726458530,方便其他人复现。这条推文目前获得 890 次浏览和 8 次点赞。AI模型MiniMaxH3Hailuo AISuno5 个信源在谈事件专题推荐理由:有人拿 Suno 做歌,再用 MiniMaxH3 生成机器人对口型,嘴型准到离谱,还给了 sref 参数,想试的可以直接抄作业。原文稍后读已读值得跟进有用关注 MiniMaxH3
11:10OpenRouter@OpenRouterAIMiniMax 发布开源权重视频模型 Hailuo H3,已上线 OpenRouter。H3 支持文本、图像、音频和视频四种输入,并输出原生音视频。官方定位包括指令驱动编辑、文字/品牌渲染和视频到视频的动作迁移。H3 主打轻量级,可直接在 OpenRouter 上调用。AI模型Hailuo H3MiniMaxOpenRouter推荐理由:开源视频模型 H3 上 OpenRouter 了,能按指令改视频、渲染品牌文字,还能视频到视频迁移动作,直接调用很方便。原文稍后读已读值得跟进有用关注 Hailuo H3
10:48官方一手歸藏(guizang.ai)@op7418精选Seedance 2.5已在超创平台开放内测,支持一次生成30秒时长的视频。当前版本最高输出分辨率为720P。其全能参考功能允许一次上传最多50张图片作为生成依据。这些参数让该模型在长视频生成和多图参考方面具备明显优势。AI模型Seedance视频生成图片参考推荐理由:Seedance 2.5内测来了,一次能生成30秒视频,还能传50张图做参考,感兴趣就去超创试试。原文稍后读已读值得跟进有用关注 Seedance
10:06IT之家(博客/媒体)MiniMax 推出 H3 全模态生成模型,支持文本、图像、视频、声音的统一理解,并可输出原生双声道音视频。该模型最高支持 15 秒 2K 分辨率输出,在指令遵循、文字呈现和 V2V Motion Transfer 等任务上表现突出。MiniMax H3 新增 Caption 能力,大部分素材消耗约 100K Token 推理,最终平均输出约 4K Token。其 2K 视频不依赖常规超分模块,而是由 H3 基础模型对低分辨率结果进行 in-context 重新生成。模型权重将在未来几天内开放。AI模型MiniMax H3MiniMax视频生成5 个信源在谈事件专题推荐理由:MiniMax 发了新模型 H3,可生成带双声道音效的 2K 视频,超分用模型自己重画而非传统模块,过几天开源权重。原文稍后读已读值得跟进有用关注 MiniMax H3
03:38Hailuo AI@Hailuo_AIJPN GIRL在X上分享了一段使用MiniMax H3模型在Hailuo_AI平台制作的视频,内容涉及角色“パン子ちゃん”。该推文获得1014次浏览,1条回复,8个点赞。MiniMax H3是MiniMax推出的视频生成模型,支持用户快速创建角色动画。AI产品MiniMaxH3Hailuo_AI视频生成5 个信源在谈事件专题推荐理由:看看别人用MiniMax H3做的角色视频,效果挺有趣,能直观感受这个视频生成能力的实际表现。原文稍后读已读值得跟进有用关注 MiniMaxH3
01:45Hailuo AI@Hailuo_AIMiniMax H3 模型成功替换了一个真实商业广告中的产品,所有演员、摄像机移动和阴影均保持原样。该演示由用户 Abdul Shakoor 分享,展示了模型对广告场景的高度还原能力。Hailuo_AI 官方转发了这一案例,引发广泛关注。AI模型MiniMax H3Hailuo_AI视频生成5 个信源在谈事件专题推荐理由:每个广告公司都应该看看 MiniMax H3 怎么把真实广告里的产品替换掉,演员和镜头完全不变,太强了。原文稍后读已读值得跟进有用关注 MiniMax H3
11:09小互@imxiaohuMagnific 发布了 38 页的全新提示词手册,核心观点是传统关键词式提示已失效。手册提出 AI 已进入推理(Reasoning)与导演对话时代,需要用明确的专业视觉语言指挥前沿模型。该手册针对当前主流图像和视频生成模型提供实用指南。技巧Magnific提示词工程推理模型推荐理由:Magnific 出了本 38 页的提示词手册,教你用导演思维跟 AI 对话,不再堆关键词,适合想用好前沿图像视频模型的人。原文稍后读已读值得跟进有用关注 Magnific
09:23官方账号arXiv cs.LG@Taiye Chen, Qi Zhang, Yisen Wang视频扩散世界模型在自动驾驶、机器人等任务中生成长视频时,滑动窗口自回归推理会导致误差累积,使帧质量随时间下降。研究发现,复合误差与隐藏表示的维度塌缩紧密相关,有效秩在生成漂移开始时急剧下降。单纯扩大训练数据无法提升模型抗误差漂移能力。提出视频表示正则化,通过轻量训练约束稳定潜在表示,抑制迭代误差累积。相比Diffusion Forcing方法,在VBench的美学质量指标上从38.65提升至55.56,成像质量从44.37提升至72.08。论文Video World ModelsDiffusion ForcingVBench推荐理由:这篇论文揭示了视频世界模型长视频生成不稳定的根本原因——表示维度塌缩,并提出了一个简单有效的正则化方法,在VBench上大幅超过Diffusion Forcing。原文稍后读已读值得跟进有用关注 Video World Models
11:35官方账号arXiv cs.LG@Neta Shaul, Chao Liu, Arash Vahdat, Julius Berner论文提出Parallel Decoding Distillation (PDD),一种基于轨迹的蒸馏方法,用于加速扩散模型和流匹配模型的推理。PDD兼容LTX-2.3 Text-to-Video/Audio、Wan 14B Text-to-Video和Qwen-Image Text-to-Image等预训练模型,支持4-8次函数评估。相比依赖变分分数蒸馏(VSD)和对抗损失的方法,PDD训练更简单,避免了模式坍塌,提升了生成视频的多样性。论文Parallel Decoding DistillationLTX-2.3Wan 14B推荐理由:这篇论文提出PDD方法,能用更少的采样步数生成高质量视频和图像,而且训练比VSD简单多了,适合搞生成加速的研究者看看。原文稍后读已读值得跟进有用关注 Parallel Decoding Distillation
11:10官方账号arXiv cs.AI@Carlos Celemin, Benedict Wilkins, Adrián Barahona-Ríos, Saman Zadtootaghaj, Nabajeet Barman该研究探索了视觉语言模型(VLMs)在基于agent的游戏QA管道中检测几何裁剪异常。自定义探索agent收集视觉数据,自动标注管道提供帧级标签。零样本设置下测试了Gemini、GPT、Qwen、Gemma、Llama和Ministral六种VLM及四种提示变体。Gemini-3.1-Flash在总体准确率和提示鲁棒性上表现最佳,开源模型则对提示设计敏感。当前VLMs更适合作为多阶段QA管道中的高召回候选过滤器。论文GeminiGPTQwen推荐理由:这篇论文用六种VLM检测游戏里的几何裁剪bug,发现Gemini最稳,开源模型要看怎么问提示词。想了解VLM实际落地坑点的可以看看。原文稍后读已读值得跟进有用关注 Gemini
11:57官方账号arXiv cs.LG@Bingnan Li, Haozhe Wang, Haozhong Xiong, Fangtai Wu, Jinpeng Yu, Yang Shi, Jiaming Liu, Ruihua Huang本文研究在策略蒸馏(OPD)中分类器自由引导(CFG)的作用。现有OPD方法直接匹配教师和学生模型的引导速度,但在分支级别存在欠辨识问题:正负分支误差可相互补偿。作者发现,在共享负条件时匹配仍有效,但当教师负分支包含学生无法获取的特权信息时,会导致负分支不对称(NBA)失败模式。为解决NBA,提出正方向匹配(PDM),分别约束正预测和CFG条件方向。将PDM应用于稠密到稀疏视频控制,比朴素引导匹配更鲁棒有效。论文扩散模型知识蒸馏分类器自由引导推荐理由:这篇论文发现了现有扩散蒸馏方法在CFG下的一个隐蔽问题,并给出了一个简单的修正方案。做扩散模型蒸馏或视频生成的同学可以看看。原文稍后读已读值得跟进有用关注 扩散模型
23:23官方账号快手可灵 Kling@Kling_AI本教程由@onofumi_AI制作,演示如何使用Kling MCP创建美容院广告视频,涵盖概念规划、视觉创建和最终制作三个阶段。该推文获得1879次浏览和18个点赞。用户可跟随步骤将创意转化为专业营销内容。技巧Kling MCP视频生成广告制作推荐理由:想用AI快速出广告片?这个Kling MCP教程一步步教你,美容行业尤其适用。原文稍后读已读值得跟进有用关注 Kling MCP
18:07AI Will@FinanceYF5Claude Opus 5 在不到 10 分钟内生成了一个 38 秒的电影级镜头序列。这是第一次迭代便直接输出成品,无需任何剪辑或后期处理。整个生成过程通过 Claude Code 完成,展示了模型强大的视频生成能力。该结果由用户 Samnang Aing 分享,附带了完整的聊天记录。AI模型ClaudeOpus 5视频生成10 个信源在谈事件专题推荐理由:Claude Opus 5 十分钟就能做出电影级片段,一次成功零剪辑,效果太惊人了。原文稍后读已读值得跟进有用关注 Claude
02:30OpenRouter@OpenRouterAIOpenRouter 平台宣布其模型库已从仅支持 LLM 扩展至包含图像、视频和音频模型。用户可在同一界面浏览所有主流多模态模型,并通过视觉对比功能快速评估模型表现。该平台目前集成了如 DALL-E 3、Stable Diffusion、Runway Gen-3 等热门生成模型,覆盖生成式 AI 的主要模态。AI产品OpenRouter多模态视频生成推荐理由:OpenRouter 把图像、视频、音频模型都聚到一个平台上,还能直接对比效果,省去到处找的时间。原文稍后读已读值得跟进有用关注 OpenRouter
22:41AI Will@FinanceYF578°奥斯卡提名导演Neill Blomkamp发布了首部AI电影《NIGHTBORNE》,片长13分钟,使用Seedance 2.0平台制作,耗时不到两周。电影融合了32位真人演员的面孔和声音(均已获得许可)。Blomkamp同时宣布成立新AI工作室Barley Studios,并计划制作下一部AI长片。AI产品NIGHTBORNENeill BlomkampSeedance 2.0推荐理由:想知道AI拍电影多快?Blomkamp用Seedance 2.0两周就搞出13分钟科幻片,还用了32个真人演员,值得看看。原文稍后读已读值得跟进有用关注 NIGHTBORNE