6月30日
03:06
6月29日
23:49
23:49官方账号阶跃星辰 Stepfun@Stepfun_AI
精选
StepFun 的 Step 3.7 Flash 模型在 Claw-Eval General 基准测试中取得第二名的成绩,该基准用于评估自主智能体。模型在多步执行和长程任务鲁棒性上表现强劲,排名仅次于 Claude Opus 4.6。这一结果显示其在真实世界智能体工作负载中的潜力。

推荐理由:StepFun 的 Step 3.7 Flash 在智能体基准 Claw-Eval General 排第二,仅次于 Claude Opus 4.6,多步执行和长程任务都强,感兴趣可以看看。
19:47
19:47eric zakariasson@ericzakariasson
73°
Elon Musk在推文中透露,Cursor团队为v9模型的SFT和RL训练做出了重要的工程贡献。当前1.5T参数量的模型已通过补充训练加入Cursor数据。而两周前开始的2T参数量训练在数据范围和规模上大幅改进,训练配方也获得多项升级,预计7月底完成,8月发布。
事件专题

推荐理由:Elon Musk说他们和Cursor团队合作训练v9模型,2T参数量的版本数据更全,8月就能见到,值得关注。
17:55
17:45
17:45Browser Use@browser_use
Browser Use 团队使用 v4 版本构建 QA 基准测试,将 GLM 5.2、Opus 4.7、GPT 5.5 和 Minimax M3 四个模型在 LLM Arena 数据集上的任务进行对比。每个模型生成网站后由人工评估打分,测试涵盖多个任务类型。结果揭示了开源权重模型在特定场景下的表现差异。
事件专题

推荐理由:他们用 Browser Use v4 搞了个新基准,测了 GLM 5.2、Opus 4.7、GPT 5.5 和 Minimax M3,人工打分告诉你谁在 QA 任务上更强。
16:17
15:41
15:19
15:19Geek@geekbb
推文作者分享了使用 Qwen3-8B 模型与 DSpark 工具进行本地部署的体验。该推文获得 737 次查看,反映了用户对消费级显卡运行大模型的渴望。当前消费级显卡显存普遍不足,难以直接运行 8B 参数模型。

推荐理由:有人实测了 Qwen3-8B 配合 DSpark 本地跑,说能流畅运行但显存不够,感觉消费级显卡该升级了。
13:51
13:51官方账号Together AI@togethercompute
在 aiDotEngineer World's Fair 上,James Zou 将展示 EinsteinArena 和 DSGym 两项工作。EinsteinArena 用于多智能体数学发现,DSGym 则为数据科学智能体提供更好的评估。这两项基准旨在推动 AI 在科学协作中的能力。

推荐理由:想知道多智能体怎么一起搞科研、怎么评估数据科学智能体?James Zou 分享了两个新基准,很实用。
13:51
13:51官方账号Together AI@togethercompute
精选
Together Compute推出ParallelKernelBench开放基准测试,专门评估LLM编写多GPU内核的难度。该基准基于50个真实CUDA通信问题,性能取决于通过NVLink高效移动数据。测试结果将于6月30日在aiDotEngineer World's Fair上由Simran Arora分享。

推荐理由:Together Compute搞了个ParallelKernelBench,专门测LLM能不能写好复杂的多GPU内核,比单GPU难多了,感兴趣的话可以去现场听分享。
13:51
13:51官方账号Together AI@togethercompute
Together AI 构建了基于 Parakeet 的语音转文本堆栈,每秒可处理约 302 秒音频,这是 Artificial Analysis 报告中最高速度因子。该堆栈在 Together 平台上运行,通过系统级优化实现低延迟转录。文章由 @FeelTheBeurn 详细拆解了背后的工程工作。

推荐理由:Together AI 把 Parakeet 优化到每秒转写 302 秒音频,比别的服务快一大截,想搞语音识别的可以看看这篇系统调优拆解。
13:51
13:51官方账号Together AI@togethercompute
GLM-5.2模型在Together AI平台上运行,生成精美Web应用的成本仅需几美分。开发者可以以极低开销探索多个方向、比较不同版本,并保留最佳结果。这显著改变了传统的构建迭代循环,降低了实验门槛。
推荐理由:GLM-5.2在Together AI上几美分就能生成网页应用,开发者可以随便试不同版本,挑最好的,省钱又高效。
13:50
13:50官方账号阿里云 Alibaba Cloud@alibaba_cloud
阿里云宣布 HappyHorse 1.1 即日起作为 Creative Fabrica Studio 的默认 AI 视频生成模型上线。新模型提供更快的生成速度和更高的视频质量。为庆祝升级,所有使用 HappyHorse 1.1 的视频生成享 50% 折扣,优惠持续一周。该模型面向设计师、营销人员和内容创作者开放。

推荐理由:阿里云升级了HappyHorse 1.1,现在Creative Fabrica Studio默认用它生成视频,速度更快画质更好,而且这周所有视频生成都打五折。
13:50
13:50官方账号阿里云 Alibaba Cloud@alibaba_cloud
精选
在 Flink Forward Asia Shenzhen 2026 上,阿里巴巴云研究员冯王提到,AI 时代模型与数据共同决定智能体质量。Apache Flink 升级为 Agentic Streaming for AI,并与 Agentic Lake 协同,构建面向 AI 的原生数据基础设施。该架构支持实时代理工作流,为下一代智能体提供统一数据底座。

推荐理由:阿里巴巴把 Apache Flink 改造成专门给 AI 智能体用的实时流处理引擎,和 Agentic Lake 搭着用,比传统批处理更适合 Agent 场景。
13:50
13:50官方账号阿里云 Alibaba Cloud@alibaba_cloud
阿里云推出HappyHorse 1.1视频生成模型,已在ComfyUI、runware、fal、replicate、Picsart等平台集成。开发者可通过阿里云Model Studio直接调用模型进行创作。该版本优化了视频生成质量和效率。

推荐理由:阿里云最新的视频生成模型HappyHorse 1.1,ComfyUI和Fal这些平台都已经接上了,想试试直接去Model Studio玩。
13:50
13:50官方账号阶跃星辰 Stepfun@Stepfun_AI
StepFun宣布与Cline合作,将其Step 3.7 Flash模型集成到Cline中。该模型专为代理式编程工作流设计,具备能力、速度和可靠性。从即日起,Cline用户可免费使用Step 3.7 Flash一个月。用户只需在Cline中输入'/model → Step 3.7 Flash'即可切换。
推荐理由:StepFun把自家Step 3.7 Flash模型免费给Cline用一个月,写代码的代理工作流更稳更快了,试试看。
13:50
13:50官方账号阶跃星辰 Stepfun@Stepfun_AI
精选
StepFun 发布 Step 3.7 Flash 模型,专为高效智能体工作负载设计。该模型具备原生多模态理解、强智能体编程能力、可靠工具调用以及网页与视觉搜索工作流。模型已通过 Novita Labs 在 OpenRouter 平台上提供。StepFun 称这是为生产级 AI 智能体打造的高效方案。
推荐理由:StepFun 刚出了 Step 3.7 Flash,专为智能体打造的模型,多模态、能编程、会搜图搜网页,现在就能在 OpenRouter 上试。
13:49
13:49官方账号阶跃星辰 Stepfun@Stepfun_AI
精选
Step 3.7 Flash 是开源多模态推理模型,现已在 DeepInfra API 上线。该模型支持私有端点部署,适用于专用负载场景。它专为智能体编码、工具使用、搜索和视觉工作流设计。开发者可通过 DeepInfra 的 API 直接调用。
推荐理由:Step 3.7 Flash 开源多模态推理模型刚上线 DeepInfra,支持私有部署,适合智能体编程和视觉任务,开发者可以试试。
13:49
13:49官方账号Microsoft AI@MicrosoftAI
精选
微软推出新编程模型 MAI-Code-1-Flash,在真实 GitHub Copilot 环境中训练,具备高速和 token 高效特性。该模型可通过 VS Code 的 Copilot Chat 完成规划、构建、运行和测试。演示中,它从单个 frost banner 生成完整季节性快照并通过测试,耗时几分钟,成本仅几美分。
推荐理由:微软出了个新模型 MAI-Code-1-Flash,直接在 Copilot 里跑,能自动把草图变成完整测试通过的代码,又快又便宜。
13:49
13:49
13:49官方账号Jasper AI@heyjasperai
精选72°
Jasper Research 宣布推出 MONET 数据集,从 29 亿张图片中精炼出 1.049 亿张高质量样本,成为全球最大的开放文本-图像数据集。该数据集采用 Apache 2.0 许可,可免费商用。同时发布的 nano-t2i 方案支持在单张 GPU 上训练有竞争力的文生图模型。

推荐理由:Jasper Research 放出了 MONET 数据集,有 1 亿多张图,免费商用,还能用 nano-t2i 在单卡上训练模型,做文生图的值得试试。
13:48
06:45
06:45官方账号Clement Delangue@ClementDelangue
DeepSeek 推出加速模型集合,其中 Gemma-4-12B 可能包含视觉能力。该模型在其 12B 参数量级别中,本地运行性能显著优于同类竞品。该集合未包含 Qwen 3.5,推测因 DeepSeek 未采用线性注意力机制。
推荐理由:DeepSeek 把 Gemma-4-12B 加速了,还带视觉,本地跑起来应该是同尺寸里最强的之一。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。