8月21日
22:04
7月24日
13:03
13:03官方账号Latent Space (swyx)博客/媒体
Black Forest Labs 发布了 FLUX 3,这是一种多模态流模型。它在图像生成等任务上击败了 Seedance 2.0、Gemini Omni 和 Grok Imagine。此外还推出了 FLUX-mimic 视频动作机器人模型。这些模型展示了 BFL 在多模态生成和机器人领域的进展。
事件专题

推荐理由:BFL 新出的 FLUX 3 图像生成超强,直接吊打 Seedance 2.0、Gemini Omni 和 Grok Imagine,还带了个机器人模型,快来看看。
7月10日
09:44
09:44官方一手arXiv: DeepSeek@Zuming Huang, Jun Huang, Kexuan Ren, Baode Wang, Weizhen Li, Jianming Feng, Yu Wang, Yichen Yao, Shijun Lin, Yige Tang, Cheng Peng, Weidi Xu, Wei Chu, Yinghui Xu, Yuan Qi
精选
Infinity-Parser2 是一个大型多模态模型,通过可控数据合成管道和多任务强化学习实现端到端文档解析。研究团队构建并开源了包含500万样本的中英双语数据集Infinity-Doc2-5M,涵盖多种文档类型和标注形式。模型采用8个联合训练目标,包括文档解析、布局分析、表格/数学公式/图表/化学公式解析及文档VQA。Infinity-Parser2-Pro 在olmOCR-Bench上达到87.6%,在ParseBench上达到74.3%,超越DeepSeek-OCR-2、PaddleOCR-VL-1.5和MinerU2.5。Flash变体推理吞吐量较Infinity-Parser-7B提升3.68倍。
推荐理由:Infinity-Parser2 用多任务强化学习搞定文档解析,开源了500万样本数据集,Pro版在OCR基准上刷新纪录,Flash版速度快3倍多。适合做文档智能处理的开发者。
6月12日
22:52
22:52官方账号NVIDIA AI@NVIDIAAI
MiniMax 团队发布了 MiniMax M3,这是一个支持文本、图像和视频推理的长上下文多模态模型。模型采用稀疏注意力机制,总参数量约 428B,激活参数仅约 23B,在保持高性能的同时大幅降低了计算成本。该模型已开源权重,可在 Hugging Face 获取,并可通过 NVIDIA 的 GPU 加速端点免费试用。M3 的长上下文能力使其在处理视频、长文档等场景中具有优势。
事件专题

推荐理由:多模态推理模型终于有了高效的开源选择——MiniMax M3 用 23B 激活参数实现长上下文多模态推理,做视频分析或长文档处理的团队可以直接在 NVIDIA 端点免费试,值得关注。
11:45
11:45官方账号Microsoft AI@MicrosoftAI
精选
微软AI实验室在MSBuild 2026上发布了7个新模型,涵盖推理、代码、图像、语音和转录能力。这些模型基于科学和清洁的商业安全数据构建,设计为无缝协作。微软AI负责人Mustafa Suleyman在主题演讲中展示了这些进展,标志着微软在AI领域的快速扩张。

推荐理由:微软一口气推出7个覆盖多模态的模型,做AI应用开发的团队可以直接集成这些能力,减少自研成本,值得关注。
6月9日
6月4日
08:22
08:22berryxia@berryxia
Google 昨晚发布了 Gemma 4 12B 多模态大模型,该模型支持文本和图像输入,最低只需 16GB 内存即可运行。这降低了多模态模型的本地部署门槛,适合个人开发者和资源受限的环境。与 Qwen 等同类模型的对比结果值得关注,可能影响开源多模态模型的竞争格局。
事件专题

推荐理由:多模态模型本地运行门槛进一步降低,做 AI 应用或本地部署的开发者可以关注 Gemma 4 与 Qwen 的对比,评估是否值得迁移或尝试。
6月1日
16:03
16:03官方一手pandaily@contact@pandaily.com (Pandaily)
在 BEYOND Expo 2026 上,OmAI 推出了 AI 视频创作助手 OttoBox,基于自研多模态模型 OmModel。该工具能将视频粗剪时间从 8 小时缩短至 30 分钟,大幅提升创作效率。OttoBox 面向视频创作者、营销团队和内容制作人,旨在降低视频制作门槛。这一发布标志着 AI 在视频编辑领域的实用化进展。

推荐理由:视频创作者和营销团队终于有了能真正省时间的 AI 工具——粗剪从半天缩到半小时,建议做短视频或宣传片的直接试试。
15:07
15:07官方账号NVIDIA AI@NVIDIAAI
精选
NVIDIA 宣布其 Cosmos 3 模型完全开源,包括模型权重和训练配方。该模型已在 Hugging Face 上发布,供开发者自由使用。此举延续了 NVIDIA 在 AI 领域开放生态的策略,旨在推动更多创新应用。Cosmos 3 的开放将加速研究者和工程师在视觉、语言等多模态任务上的探索。
事件专题

推荐理由:NVIDIA 把 Cosmos 3 的权重和训练配方全开源了,做多模态研究的团队可以直接下载使用,省去从头训练的算力成本,值得点开看看。
15:06
15:06官方账号NVIDIA AI@NVIDIAAI
精选
NVIDIA AI 发布了一个基于数十亿跨模态样本训练的多模态预训练模型,旨在为开发者提供强大的基础模型,用于构建物理AI系统。该模型能显著减少所需的数据量和训练成本,使开发者能够更高效地开发机器人、自动驾驶等物理AI应用。NVIDIA 在技术博客中详细介绍了该模型的架构和性能优势。
事件专题

推荐理由:做物理AI(如机器人、自动驾驶)的开发者终于有了一个强大的预训练基础,能大幅降低数据收集和训练成本,建议直接查看技术博客了解细节。
5月29日
5月28日
11:27
11:27官方账号arXiv cs.AI@Xinchen Zhang, Bowei Liu, Jiale Liu, Chufan Shi, Yizhen Zhang, Junhong Liu, Youliang Zhang, Zhiheng Li, Yujiu Yang, Ling Yang
精选
多模态大模型的视觉输出需要可靠且细粒度的验证。本文提出多模态元验证方法,发现符号化验证器输出(如边界框)比文本解释更有效,且将二元判断与元验证的强化学习目标解耦能显著提升性能。基于此训练的OmniVerifier-M1通用视觉验证器,不仅提供稳健验证和细粒度错误定位,还驱动了M1-TTS智能体生成系统,实现动态区域级自我修正。该工作为更可靠、可解释的多模态验证铺平道路,支持更安全可控的基础模型部署。
推荐理由:做多模态模型评估或安全部署的团队,可以关注这种符号化元验证思路——它用边界框替代文本解释做奖励信号,既高效又避免依赖辅助模型,直接提升验证的细粒度与可解释性。
5月22日
16:09
5月21日