6月12日
22:52
22:52官方账号NVIDIA AI@NVIDIAAI
MiniMax 团队发布了 MiniMax M3,这是一个支持文本、图像和视频推理的长上下文多模态模型。模型采用稀疏注意力机制,总参数量约 428B,激活参数仅约 23B,在保持高性能的同时大幅降低了计算成本。该模型已开源权重,可在 Hugging Face 获取,并可通过 NVIDIA 的 GPU 加速端点免费试用。M3 的长上下文能力使其在处理视频、长文档等场景中具有优势。
事件专题

推荐理由:多模态推理模型终于有了高效的开源选择——MiniMax M3 用 23B 激活参数实现长上下文多模态推理,做视频分析或长文档处理的团队可以直接在 NVIDIA 端点免费试,值得关注。
13:08
13:08官方账号Guillaume Lample (Mistral)@GuillaumeLample
Mistral 发布了 Voxtral 2,包含两个新模型:Voxtral Realtime(实时转录,延迟可低于 200 毫秒,Apache 2 许可)和 Voxtral Mini Transcribe 2(支持说话人分离、词级时间戳和上下文偏置)。该模型支持 13 种语言,通过 Mistral API 提供,是市场上性价比最高的转录 API 之一。

推荐理由:做语音转录或实时字幕的开发者终于有了一个开源且低延迟的选择——Voxtral Realtime 的 Apache 2 许可和 sub-200ms 延迟值得一试。
12:22
12:22向阳乔木@vista8
开发者@vista8分享了使用Fable 5开发在线Photoshop的案例,核心是先用一个专门为AI设计的PRD文档生成Prompt,生成需求文档后再交给AI Agent开发。这种方法能显著提升功能完整度和丰富性,比直接让AI开发更精准高效。视频展示了P0需求点的开发效果,并提供了开源地址和安装指令。
事件专题

推荐理由:AI Agent开发效率虽高,但PRD质量直接影响结果——这个专门为AI设计的PRD Prompt解决了需求不精准的痛点,做AI应用开发的团队可以直接拿来用,提升开发效果。
12:19
12:19官方账号Tri Dao (FlashAttention)@tri_dao
精选
一位开发者宣布,快速 muon 优化器即将支持消费级显卡。所有代码均以 matmul + epilogue 形式编写,因此一旦为 Blackwell 消费级显卡实现了主循环,所有高级对称矩阵乘法即可自动获得光速性能。这意味着普通用户也能在自家显卡上高效运行该优化器,无需依赖专业硬件。
推荐理由:这个优化器让消费级显卡也能跑出专业级训练性能,做模型微调或自训练的开发者可以直接关注,省下买高端硬件的钱。
12:08
12:08官方账号vLLM@vllm_project
精选
vLLM-Omni 项目在 GitHub 上达到 5000 星标,从去年 11 月社区启动至今,已发展为支持 30 多种多模态模型的高效推理引擎。它覆盖 Qwen3-Omni、HunyuanImage-3.0、Wan 2.2、BAGEL、MiMo-Audio 和 Flux2 等模型,并兼容 NVIDIA、AMD、华为昇腾、Intel 等多种硬件。该项目致力于提供可扩展、开源的多模态推理方案,吸引了大量社区贡献。
事件专题

推荐理由:多模态推理开发者终于有了一个统一的高效引擎——vLLM-Omni 支持 30+ 模型和多种硬件,做多模态应用或推理优化的团队可以直接拿来用,省去重复造轮子的时间。
12:05
12:05官方账号Allen AI (Ai2)@allen_ai
精选
Allen AI 宣布其机器人基础模型 MolmoAct 2 在不到一个月内被下载超过 40 万次。现在他们开源了完整的代码和训练数据,允许开发者进行微调或在此基础上构建。这标志着机器人领域的一个重要开放资源,降低了进入门槛。

推荐理由:机器人开发者终于有了一个完全开源的基础模型可用,MolmoAct 2 的完整代码和数据让你可以直接微调或构建自己的机器人应用,值得立即尝试。
10:48
10:48官方账号arXiv cs.AI@Amy Xin, Jiening Siow, Junjie Wang, Zijun Yao, Fanjin Zhang, Jian Song, Lei Hou, Juanzi Li
EurekAgent 提出了一种新的自主科学发现框架,认为瓶颈在于设计智能体的执行环境而非工作流程。该框架通过权限、工件、预算和人机交互四个维度的环境工程,实现了高效探索和协作。在数学、内核工程和机器学习任务上取得了新突破,例如以不到11美元的API成本发现了新的26圆填充方案。研究团队开源了代码和结果,呼吁将环境工程作为自主研究智能体的核心研究方向。
推荐理由:EurekAgent 用环境工程解决了自主科学发现中智能体行为失控和效率低下的痛点,做AI研究自动化的团队可以直接借鉴其四维设计思路,成本极低且效果显著。
10:14
10:14官方账号arXiv cs.AI@King Yeung Tsang, Zihao Zhao, Vishal Venkataramani, Haizhou Shi, Zixuan Ke, Semih Yavuz, Shafiq Joty, Hao Wang
多智能体系统(MAS)依赖大语言模型(LLM)进行有效编排,但训练编排器面临监督信号稀缺和计算成本高的问题。本文提出OrchRM,一种自监督框架,通过多智能体执行过程中的中间产物构建胜负对,训练Bradley-Terry奖励模型,无需人工标注。相比依赖昂贵子智能体回滚的现有方法,OrchRM直接在编排层面操作,将训练效率提升10倍(以token使用量计),并将测试时扩展的准确率提升8%。该方法在数学推理、网页问答和多跳推理等多个领域均有效,代码已开源。
推荐理由:做多智能体系统编排的团队终于有了一个低成本、高回报的训练方案——OrchRM 省去了人工标注和子智能体回滚,直接提升 8% 准确率,建议做 MAS 的开发者试试这个开源框架。
03:12
03:12官方账号Simon Willison’s Weblog博客/媒体
精选
Datasette 1.0a33 是迈向 1.0 稳定版的重要一步,将 ?_extra= 模式从表扩展到查询和行。该模式现已正式文档化。作者还利用 Claude Code 和 Codex Desktop 构建了自定义 extras API 浏览器来演示新功能。该版本进一步增强了 Datasette 的 JSON API 灵活性,方便开发者按需获取数据。

推荐理由:Datasette 用户终于可以在查询和行级别使用 ?_extra= 模式,做数据 API 开发的团队可以直接升级体验更灵活的 JSON 输出。
01:50
01:50Ideogram@ideogram_ai
Ideogram 4.0 是 Ideogram 首个开放权重的模型,发布一周后,开源和创意社区已经用它做出了超出预期的应用。JSON 和边界框提示(bounding box prompting)正在成为新的标准用法。官方在推文中汇总了第一周的社区亮点,展示了模型在可控生成和结构化提示方面的潜力。
事件专题

推荐理由:开源图像生成模型终于有了更可控的提示方式——JSON 和边界框让精确布局成为可能,做 AI 绘画工具或创意生成的开发者值得关注社区玩法。