6月4日
23:01
23:01官方账号阶跃星辰 Stepfun@Stepfun_AI
阶跃星辰的 Step 3.7 Flash 模型已在 Fireworks AI 平台上线。该模型从设计之初就针对推理优化,采用硬件友好的架构和 MTP 辅助解码技术,推理速度可达每秒 400 tokens。Step 3.7 Flash 支持多模态输入,适合在真实工作流中驱动智能体。这一发布为开发者提供了高性能、低延迟的模型选择,尤其适合需要快速响应的应用场景。
事件专题

推荐理由:Step 3.7 Flash 以 400 tokens/s 的速度刷新了推理效率,做实时 AI 应用或智能体开发的团队可以直接在 Fireworks AI 上试用,省去自建推理基础设施的麻烦。
13:01
13:01官方账号阶跃星辰 Stepfun@Stepfun_AI
精选
StepFun 发布 Step 3.7 Flash 模型,主打高智能与高速度的平衡。该模型采用 MTP 辅助解码技术,输出速度超过 400 tokens/s,具备更强的智能体性能和原生多模态能力。模型权重以 Apache 2.0 协议开源,适合生产级智能体工作负载。独立评测者 @ArtificialAnlys 对其进行了详细评估。
推荐理由:做智能体应用或需要高吞吐推理的团队,Step 3.7 Flash 的开源高速度方案值得直接拿来用,尤其适合生产环境部署。
04:27
04:27官方账号Decoder@Matthias Bastian
78°
Google DeepMind 发布了 Gemma 4 12B 开源模型,原生支持文本、图像和音频处理,仅需 16GB 内存即可在笔记本上运行。该模型在基准测试中几乎与两倍大小的 26B 模型持平,并采用 Apache 2.0 许可证,允许商业使用。这标志着多模态 AI 在消费级硬件上的重大突破,降低了开发者和企业的使用门槛。
事件专题

推荐理由:多模态模型终于能跑在普通笔记本上了,做本地 AI 应用或边缘计算的开发者可以直接下载试试,性能还接近两倍大的模型。
04:12
04:12HeyGen@HeyGen_Official
HeyGen 与 Google DeepMind 将于6月11日在洛杉矶联合举办一场线下活动,主题聚焦智能体、多模态应用和创意工具。活动内容包括产品演示、交流讨论,并开放闪电演示名额,邀请有创新项目的团队或个人参与。这是两家 AI 领域知名公司首次公开合作举办社区活动,旨在促进前沿 AI 技术的实践与交流。

推荐理由:做 AI 应用和智能体开发的团队别错过——HeyGen 和 DeepMind 首次线下联办,有机会展示你的项目、直接和两家团队交流,闪电演示名额开放中,建议有 demo 的立刻报名。
00:31
00:31官方账号阶跃星辰 Stepfun@Stepfun_AI
Step 3.7 Flash 模型专为真实世界的智能体编程任务设计,不仅追求代码生成速度,更注重在复杂输出中保持逻辑、视觉和执行的一致性。该模型在演示中展示了其在多步骤、多模态任务中的连贯性,适合需要高可靠性的编程场景。开发者 @atomic_chat_hq 的创意测试进一步验证了其能力。
推荐理由:做智能体编程的开发者终于有了一个兼顾速度和一致性的模型——Step 3.7 Flash 在复杂任务中保持逻辑连贯,值得在真实项目中试试。
6月3日
10:17
10:17官方账号arXiv cs.AI@Senjie Jin, Peixin Wang, Boyang Liu, Xiaoran Fan, Shuo Li, Zhiheng Xi, Jiazheng Zhang, Yuhao Zhou, Tao Gui, Qi Zhang, Xuanjing Huang
精选
研究发现,在视觉推理任务中,仅依赖令牌级熵进行强化学习(RLVR)会失效,因为视觉敏感但熵低的令牌被忽略。现有多模态RL方法要么缺乏系统视觉度量,要么忽视熵主要驱动语义探索。为此,研究者提出VEPO框架,通过视觉敏感性与令牌熵的乘法耦合,将梯度信用分配给同时具备视觉基础和高信息量的令牌。实验表明,VEPO在7B和3B规模上分别比熵基线提升2.28和3.15个百分点,消融实验验证了方法的有效性。
推荐理由:视觉推理强化学习一直缺乏有效的信用分配机制,VEPO解决了这个痛点——做多模态RL的团队可以直接参考这个框架,在视觉-语义交叉场景中提升模型表现。
6月2日
17:15
17:15官方一手marktechpost@Michal Sutter
83°
阿里Qwen团队在百炼平台推出Qwen3.7-Plus,这是一个多模态智能体模型。它不仅能理解图像和视频,还新增了自主编程、工具调用和深度推理能力。该模型支持视觉理解、复杂推理和自动化迭代,可应用于更广泛的AI任务场景。这标志着阿里在构建全能型AI智能体方面迈出重要一步。
事件专题

推荐理由:Qwen3.7-Plus把视觉、推理和工具调用整合到一个模型里,做多模态应用的开发者可以直接在百炼平台体验,省去拼接多个模型的麻烦。
11:12
11:12官方账号arXiv cs.AI@Xinyu Che, Junqi Xiong, Yunfei Ge, Xinping Lei, Shihao Li, Hang Yan, Han Li, Yuanxing Zhang, Zhiqi Bai, Jinhua Hao, Ming Sun, Han Li, Jiaheng Liu
网络上有大量多模态、异构、嘈杂的程序性知识,但直接用于智能体执行长周期任务效果不佳。研究者提出 guide-to-skill 学习问题,并发布首个基准 MMG2Skill-Bench。他们设计的闭环框架 MMG2Skill 能将人类指南编译为可编辑技能,在执行时条件化固定视觉语言模型,并通过轨迹级根因反馈持续修正技能。在 GUI 控制、开放游戏和策略卡牌等六个 VLM 骨干上,该方法比基线提升 12.8 到 25.3 个百分点。消融实验表明,直接提示原始指南反而会降低性能,而结构化技能构建和轨迹驱动修正是关键。
推荐理由:做智能体长任务规划的团队终于有了把网络教程变成可执行技能的方案——MMG2Skill 直接解决了指南与技能之间的鸿沟,做 GUI 自动化或游戏 AI 的开发者可以试试这个闭环框架。
10:58
08:23
08:23Guillermo Rauch@rauchg
76°
MiniMax M3 在 Next.js 智能体评测中成为领先的开源模型,性能仅次于 Opus 和 GPT-5,但成本低 10 倍。这是 MiniMax 首个支持多模态输入的长上下文模型。Vercel 宣布 M3 已上线 AI Gateway,并提供一周 50% 折扣。开发者可以以极低成本获得接近顶级模型的智能体能力。
事件专题

推荐理由:做 Next.js 智能体开发的团队终于有了高性价比的开源选择——M3 性能接近 Opus 但成本仅 1/10,Vercel 用户现在就能用上,建议立刻试试。
6月1日
11:12
11:12OpenRouter@OpenRouterAI
精选76°
MiniMax 发布了 M3 模型,这是首个同时具备编码、智能体与多模态能力的开源权重模型。在 SWE-Bench Pro 上达到 59.0%,Terminal Bench 2.1 上 66.0%,并支持 1M 上下文窗口。模型原生多模态,从零开始训练,权重和技术报告将在约 10 天后公开。API 已上线 platform.minimax.io,并提供 MiniMax Code 工具。
推荐理由:MiniMax M3 把编码、智能体和多模态三个前沿能力打包进一个开源模型,做 AI 应用开发或智能体研究的团队可以直接用 API 体验,值得关注即将开源的权重。