13:27IT之家(博客/媒体)MiniMax H3 于 8 月 3 日正式开源,支持文本、图片、音频和视频的多元输入,可直出 2K 分辨率、最长 15 秒的原生音画内容。该模型在 Artificial Analysis 视频模型榜单中拿下视频编辑能力全球第一,2K 分辨率视频生成价格低至 0.8 元/秒。摩尔线程基于 MTT S5000 与 MUSA 软件栈,仅用 3 小时就完成 H3 的完整适配与稳定运行。H3 支持企业本地化部署和自有数据定制,降低了多模态生成的应用门槛。AI模型MiniMaxH3摩尔线程推荐理由:MiniMax H3 开源当天就被摩尔线程国产卡接住了,2K 视频生成一秒钟才 8 毛钱,视频编辑能力还排全球第一。原文稍后读已读值得跟进有用关注 MiniMax
13:12官方账号arXiv cs.AI@Hengji Zhou, Ye Liu, Yufeng Liu, Si Wu, Lianghao Xia, Liqiang Nie这篇论文提出TailorMind,一种链接协同偏好建模与可控多模态生成的框架。它通过超图协同过滤丰富稀疏用户历史,并利用排序误差反馈和文本梯度下降优化文本档案。检索增强风格控制与跨模态一致性反射减少语义漂移。论文构建了TailorBench基准,从一致性、新颖性、美学、幻觉、画像五个维度评估。实验表明,TailorMind在多个维度超过现有生成基线和真实用户生成内容,重排序召回率提升29%。论文TailorMindTailorBench多模态生成推荐理由:这篇论文发了TailorMind,能根据用户行为痕迹直接生成个性化多模态内容,不用等现成素材。在一致性、新颖性上超过现有方法,召回率提升29%。原文稍后读已读值得跟进有用关注 TailorMind
09:38官方账号arXiv cs.AI@Zhihong Liu, Siqi Kou, Zheng Li, Ye Ma, Quan Chen, Peng Jiang, Kai Yu, Zhijie DengProductWebGen 是一个用于评估多模态生成模型在电商产品网页生成任务上能力的基准测试。它包含 500 个测试样本,覆盖 13 个产品类别,每个样本提供源图像、视觉内容指令和网页布局指令,要求模型生成包含多张一致图像的 HTML 网页。研究对比了两种工作流:基于图像编辑模型和语言模型的编辑式方法,以及基于统一多模态模型的端到端方法。实验表明编辑式方法在网页指令遵循和内容吸引力上领先,而统一模型在视觉内容指令执行上更有优势。团队还构建了包含 1000 组真实产品图像和 LLM 生成 HTML 代码的微调数据集 ProductWebGen-1k,并在开源模型 BAGEL 上验证了其有效性。论文多模态生成电商/广告基准测试推荐理由:电商和广告领域的开发者终于有了一个标准化的产品网页生成评测工具——ProductWebGen 帮你快速对比不同多模态模型在可控生成上的真实表现,做营销自动化或电商页面生成的团队值得关注。原文稍后读已读值得跟进有用关注 多模态生成
15:20AI Will@FinanceYF5Google 发布了全新模型 Gemini Omni,能够根据任意输入(如文本、图像、音频)生成任意输出内容,首先支持视频生成。该功能将集成到 Gemini App、Flow 和 YouTube 中,API 支持即将推出。Omni 被视为“Nano Banana”的视频版,标志着多模态生成能力的重大突破。这一进展将极大简化内容创作流程,尤其对视频创作者和开发者意义重大。AI产品Gemini Omni多模态生成视频生成推荐理由:多模态生成从文本扩展到视频,做内容创作或视频开发的团队可以直接在 Gemini App 和 YouTube 中体验,建议第一时间试用。原文稍后读已读值得跟进有用关注 Gemini Omni
19:12官方账号arXiv cs.AI@Guohui Zhang, XiaoXiao Ma, Jie Huang, Hang Xu, Hu Yu, Siming Fu, Yuming Li, Zeyue Xue, Lin Song, Haoyang Huang, Nan Duan, Feng Zhao精选OmniNFT 提出了一种面向联合音视频生成的扩散强化学习框架,解决了多目标强化学习中优势不一致、梯度失衡和信用分配不均三大问题。该方法通过模态级优势路由、层级梯度手术和区域级损失重加权,显著提升了音频和视频的感知质量、跨模态对齐和音视频同步。在 JavisBench 和 VBench 基准测试中,基于 LTX-2 骨干的 OmniNFT 实现了全面性能提升。该工作为多模态生成任务中的强化学习应用提供了新范式。论文扩散模型强化学习多模态生成推荐理由:做多模态生成或音视频联合建模的团队,终于有了一个能同时优化模态内质量和跨模态对齐的 RL 框架,值得关注其方法论对自家任务的迁移潜力。原文稍后读已读值得跟进有用关注 扩散模型
19:12官方账号arXiv cs.AI@Runhui Huang, Jie Wu, Rui Yang, Zhe Liu, Hengshuang Zhao精选70°AlphaGRPO 是一个将 GRPO 强化学习方法应用于统一多模态模型(UMMs)的新框架,无需冷启动阶段即可增强多模态生成能力。它让模型能够执行推理式文本到图像生成(主动推断用户隐含意图)和自反思优化(自主诊断并修正生成结果中的偏差)。为解决真实场景多模态生成的稳定监督问题,论文提出分解可验证奖励(DVReward),利用 LLM 将复杂请求拆解为原子化、可验证的语义与质量子问题,再由通用 MLLM 评估并提供可解释反馈。实验表明,AlphaGRPO 在 GenEval、TIIF-Bench、DPG-Bench 和 WISE 等基准上取得稳健提升,并在未训练编辑任务的情况下在 GEdit 上获得显著改进。论文多模态生成强化学习/GRPO自反思推荐理由:做多模态生成或强化学习对齐的团队值得关注——AlphaGRPO 用分解奖励解决了复杂指令的监督难题,让模型能自我反思修正,直接提升图像生成质量。原文稍后读已读值得跟进有用关注 多模态生成