7月10日
00:59
00:59官方账号LangChain@LangChainAI
Palash Shah将分享如何利用LangSmith Engine构建自我改进Agent,将生产追踪转化为持久记忆更新以持续优化Agent行为。Clay团队将展示其Agent评估框架(eval harness)的实现细节。活动由LangChain和Clay联合主办,在Luma上开放RSVP报名。

推荐理由:想了解LangChain的自我改进Agent和Clay的评估工具?这场线下Meetup有干货,Palash和Clay团队亲自讲原理和实现。
00:30
7月9日
20:40
20:40Hailuo AI@Hailuo_AI
MiniMax联合Telkomsel和华为举办了AI Cinefest 2026创作大赛,共吸引1000名AI创作者报名。经过筛选,100名创作者晋级线下决赛。决赛将于7月11日在雅加达的MiniMax Hub创意实验室举行,参赛者需在一天内完成从剧本到最终成片的全部流程。

推荐理由:MiniMax和Telkomsel、华为一起办了场AI电影创作大赛,1000人报名选100进决赛,7月11日雅加达现场从零到成片一天搞定,去瞅瞅吗?
19:53
19:19
19:19The Rundown AI@therundownai
SpaceXAI与Cursor合作发布了新版本Grok模型,具体版本号未公开。ChatGPT语音功能获得重大升级,推出GPT-Live模式。字节跳动发布Seedream 5.0模型,主要面向设计工作场景。此外还有4款新AI工具及社区工作流发布。
事件专题

推荐理由:今天AI圈动静不小,Grok更新了、ChatGPT语音又进化了、字节还出了设计模型,还有一堆新工具,一口气看完不亏。
15:10
14:25
14:25Amjad Masad@amasad
一条推文提出疑问:何时不再将自主代理与手写代码进行比较,类比编译器从不与手写汇编比较。Mehul Mohan以Bun从Zig移植到Rust为例,称使用Fable 5 API花费超16.5万美元。该案例引发关于AI代理评估标准的讨论。
事件专题

推荐理由:这个类比挺有意思,还附了一个真实的移植成本案例,可以帮你换个角度思考AI代理的评测方式。
09:42
09:42Cognition@cognition_labs
精选
Cognition的强化学习训练涉及跨越三大洲的四个数据中心。他们结合自有GPU多集群和推理提供商FireworksAI的算力,只有训练器需要紧密集合通信。推理rollout采用分布式架构,引擎通过对象存储中的压缩权重差异进行同步,实现跨区域高效训练。
推荐理由:Cognition分享了RL训练的新玩法:跨三大洲四数据中心混用自有GPU和FireworksAI,靠压缩权重差异同步,挺有意思。
05:30
05:30官方账号OpenAI@OpenAI
精选78°
OpenAI对SWE-Bench Pro进行了审计,发现该基准存在约70%的噪音上限,已无法可靠衡量前沿编码能力。该基准在业界广泛使用,但目前已被认为饱和。OpenAI决定撤回之前推荐研究社区使用该基准作为主要编码评估的建议。
事件专题

推荐理由:OpenAI发现SWE-Bench Pro这个编码基准有70%噪音上限,已经饱和了,不再适合用来衡量最强AI编码能力。
05:28
05:28官方账号OpenAI@OpenAI
OpenAI 在审计 SWE-Bench Pro 时部署了模型驱动的调查代理,并搭配五名独立资深软件工程师进行人工复审。该方法在规模化检查任务的同时保持专家判断为核心。审计结果未被详细披露,但流程强调了自动代理与人工协作的可行性。
事件专题

推荐理由:OpenAI 公布了一种审计 SWE-Bench Pro 的新方法,结合模型代理和五名资深工程师的独立评审,适合关注基准测试可靠性和自动审计的朋友。
05:27
05:27官方账号OpenAI@OpenAI
OpenAI 在推特上指出,随着编码模型不断进步,现有的评估基准已不足以衡量真实进展。他们强调需要设计更难的测试、更公平的对比和更可靠的结果。这条观点引发社区对当前基准如 SWE-bench 等是否仍有效的讨论。
事件专题

推荐理由:OpenAI 自己说现在的编码测试太简单了,得加点难度和公平性。搞 AI 写代码的可以看看基准怎么改。
02:34
02:34Harrison Chase@hwchase17
Prime Intellect 宣布完成1.3亿美元A轮融资,由 Radical Ventures 领投,NVIDIA、Intel Capital、Dell Capital 及现有投资者跟投。该公司将利用资金构建开放超级智能堆栈(Open Superintelligence Stack),使用户能自主训练、部署并持续改进模型。此轮融资将用于加速平台开发与生态扩展。
事件专题

推荐理由:Prime Intellect 融了1.3亿美元,NVIDIA和Intel都跟投了。他们要搞开放的超级智能堆栈,让你自己训练和部署模型,不用依赖大厂。
01:16
7月8日
19:19
19:19The Rundown AI@therundownai
Meta发布了新的内部AI图像模型,但未公布具体名称。北京考虑对中国AI实施新限制。DoorDash使用AI工具评审其代码。帖子中还列出了4个新AI工具和社区工作流。该帖获得7个点赞和2732次查看。

推荐理由:今天AI圈挺热闹,Meta搞了个内部图像模型,北京也在出新规,还有DoorDash用AI评代码,4个新工具也挺实用。
11:25
11:25Ethan Mollick@emollick
Anthropic 和 OpenAI 计划以极低成本提供较弱版本的前沿模型,如 Haiku 和 Instant。通过拥有从弱到强的完整智能范围,它们可能提供“模型组织”,即多个模型协同工作。这种策略有望比任何第三方提供更低的成本和更高的性能。
事件专题

推荐理由:两大巨头开始卖便宜版模型(Haiku、Instant),而且能用模型组合拳打得第三方没脾气,价格和性能都占优。
11:12
11:12官方账号Vercel AI@vercel
Vercel 宣布 better_auth 团队加入其平台,目标是通过开源认证方案加速应用和 AI agent 的身份验证。该团队此前已为 25 万+ 项目提供认证服务。整合后,开发者可直接在 Vercel 生态中使用更完善的认证功能。
推荐理由:Vercel 把认证团队收编了,以后做登录和 AI agent 的身份管理更方便,开发者可以少自己折腾。
09:36
09:36官方账号Greg Brockman@gdb
Taylor Blau(@ttaylorr_b)今日正式加入 OpenAI,担任 SCM 工具工程师。他将聚焦 Git 及版本控制系统,为 AI 代理的未来工作流构建基础设施。Blau 在入职推文中感谢了 tnm、gdb、aglover 等多位团队成员的支持。
事件专题

推荐理由:Taylor 是 Git 核心开发者,现在去 OpenAI 搞 SCM,为智能体时代建工具,很值得关注。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。