6月4日
04:27
04:27官方账号Decoder@Matthias Bastian
78°
Google DeepMind 发布了 Gemma 4 12B 开源模型,原生支持文本、图像和音频处理,仅需 16GB 内存即可在笔记本上运行。该模型在基准测试中几乎与两倍大小的 26B 模型持平,并采用 Apache 2.0 许可证,允许商业使用。这标志着多模态 AI 在消费级硬件上的重大突破,降低了开发者和企业的使用门槛。
事件专题

推荐理由:多模态模型终于能跑在普通笔记本上了,做本地 AI 应用或边缘计算的开发者可以直接下载试试,性能还接近两倍大的模型。
03:00
03:00官方账号Decoder@Matthias Bastian
78°
Ideogram 发布了其文本到图像模型 4.0 版本,作为开源权重模型,支持原生 2K 分辨率、边界框控制和改进的文本渲染。在 DesignArena 排行榜上,它在所有开源模型中排名第一,仅落后于 OpenAI 和 Google 的闭源系统。商业使用需要付费许可。
事件专题

推荐理由:对于需要高质量图像生成且注重文本准确性的创作者和开发者,Ideogram 4.0 的开源权重版本提供了顶级性能,值得尝试。
6月3日
6月2日
22:33
22:33官方一手Hugging Face: Blog博客/媒体
Holo3.1 是一个专注于本地化计算机操作的 AI 智能体模型,能够在用户设备上快速执行任务,如文件管理、应用操作等。它强调低延迟和隐私保护,无需依赖云端服务。该模型在多项基准测试中表现出色,尤其适合需要即时响应的场景。Holo3.1 的发布为本地 AI 智能体领域提供了新的选择,降低了使用门槛。
推荐理由:对于注重隐私和响应速度的开发者,Holo3.1 提供了本地化计算机操作的实用方案,可以直接在设备上运行,建议尝试集成到自动化工作流中。
17:15
17:15官方一手marktechpost@Michal Sutter
83°
阿里Qwen团队在百炼平台推出Qwen3.7-Plus,这是一个多模态智能体模型。它不仅能理解图像和视频,还新增了自主编程、工具调用和深度推理能力。该模型支持视觉理解、复杂推理和自动化迭代,可应用于更广泛的AI任务场景。这标志着阿里在构建全能型AI智能体方面迈出重要一步。
事件专题

推荐理由:Qwen3.7-Plus把视觉、推理和工具调用整合到一个模型里,做多模态应用的开发者可以直接在百炼平台体验,省去拼接多个模型的麻烦。
09:44
09:44官方一手Pandaily@contact@pandaily.com (Pandaily)
精选
Deep Principle 发布了 MPA(Materials Property Axiom),一个用于材料科学的 AI 基础模型。该模型借鉴了大语言模型的训练技术,在 40 项真实工业任务上取得了最先进的结果。MPA 能够预测材料属性,加速新材料发现和设计过程,有望在电池、半导体、合金等领域产生重大影响。这标志着 AI 在材料科学领域的应用迈出了重要一步。

推荐理由:材料科学家和工业研发团队终于有了一个强大的 AI 工具,MPA 在 40 项工业任务上达到 SOTA,能大幅缩短材料筛选周期,做新材料开发的团队值得关注。
00:33
00:33官方一手Hugging Face: Blog博客/媒体
精选72°
JetBrains 发布了 Mellum2,一个 12B 参数的混合专家(MoE)模型,专为代码生成和软件工程任务优化。该模型在 HumanEval 和 SWE-bench 等基准测试中表现优异,超越了同等规模的模型。Mellum2 基于 JetBrains 的代码数据训练,旨在为开发者提供更高效、更准确的代码补全和生成能力。该模型现已开源,可在 Hugging Face 上获取。
推荐理由:JetBrains 的 Mellum2 为 IDE 内代码生成带来了更精准的 MoE 方案,用 JetBrains 全家桶的开发者可以直接在 Hugging Face 上体验,看看它能否提升你的编码效率。
6月1日
5月31日
5月30日
5月29日
16:39
16:39官方一手pandaily@contact@pandaily.com (Pandaily)
精选
X-Square Robot 推出了 WALL-WM,这是全球首个事件级预测的具身 AI 世界模型。与传统逐帧预测不同,WALL-WM 转向语义事件理解,让机器人能够理解任务目标而非记忆像素序列。该模型预计于 2026 年 5 月正式发布。这一突破意味着机器人可以更高效地规划动作,减少对大量训练数据的依赖,推动具身智能从感知走向认知。

推荐理由:做机器人或具身智能的团队终于有了能理解任务目标的模型——WALL-WM 从像素预测升级到事件理解,直接降低训练成本,做自主导航或操作任务的开发者值得关注。
11:17
11:17官方一手pandaily@contact@pandaily.com (Pandaily)
78°
Stepfun 开源了 Step 3.7 Flash,这是一个 196B 参数的稀疏 MoE 大语言模型,专为智能体工作流优化。该模型推理速度达 400 tokens/s,并原生支持工具调用,能高效执行复杂任务。开源此举旨在推动智能体生态发展,降低开发者构建自主系统的门槛。Step 3.7 Flash 在多项基准测试中表现优异,尤其适合需要快速响应和工具集成的场景。

推荐理由:做智能体开发的团队终于有了一个原生支持工具调用且速度极快的开源模型——400 tokens/s 的推理速度能显著提升任务执行效率,建议直接上手测试。