7月22日
17:06
17:06Thomas Wolf@Thom_Wolf
Poolside AI 发布最新 agentic coding 模型 Laguna S 2.1。在 Terminal-Bench 2.1 上得分 70.2,与 5-25 倍大小的模型并列甚至领先。在 DeepSWE 基准上得分 40.4,超越部分超 1T 参数的开源模型。该模型可在单个 DGX Spark 或 Mac 上本地运行。
事件专题

推荐理由:Poolside 又出了个厉害编码模型,Laguna S 2.1 在本地就能跑,多项基准比大它几十倍的模型还强。
16:46
15:45
15:32
15:32@koltregaskes@koltregaskes
一位用户在X平台表示,经过一段时间使用后,认为GPT-5.6是自GPT-4相比GPT-3.5以来最明显的性能跳跃。该模型更善于按照指令完成任务,执行力显著增强。用户同时指出主要问题在于Codex(编程界面)仍需大量改进。
事件专题

推荐理由:有用户说GPT-5.6干活更利索比之前版本强一大截,但Codex还不够好,来看看他的体验。
14:04
14:04官方一手歸藏(guizang.ai)@op7418
78°
谷歌上线Gemini 3.6 Flash模型,相比3.5 Flash在编码、推理和工具调用上有所提升,在DeepSWE基准上输出token减少高达65%。同时推出速度更快的3.5 Flash-Light模型。谷歌宣布已开始训练Gemini 4,称规模为史上最大,目标对标GPT-5.6和Fable 5。目前模型迭代速度落后于一月一版的竞品。
事件专题

推荐理由:谷歌出了Gemini 3.6 Flash,日常模型更强了,编码和推理升级,还省了最多65%的token。另外还有个更快的3.5 Flash-Light,Gemini 4也在训练了,可以关注。
02:49
02:49OpenRouter@OpenRouterAI
PoolsideAI 发布了开放权重的 Laguna S 2.1 模型,采用 118B-A8B 混合专家架构。该模型拥有 1M 上下文窗口,专门用于智能体编码和长时任务。在 Terminal-Bench 2.1 基准上得分 70.2%,在 DeepSWE 上得分 40.4%。模型现已通过 OpenRouter 平台提供使用。
推荐理由:PoolsideAI 出的 Laguna S 2.1,118B MoE 带 1M 上下文,Terminal-Bench 上 70.2%,专搞编码智能体,想试试直接去 OpenRouter 用。
02:14
02:14Cognition@cognition_labs
精选72°
Cognition宣布Devin Outposts可在NVIDIA Brev上部署。这一集成使Devin能够访问GPU基础设施,用于调试训练运行、检查GPU状态、重现故障,并在实际硬件上验证修复。部署入口位于brev.nvidia.com的launchable页面。该方案面向需要GPU调试的AI工程团队。
事件专题

推荐理由:Cognition把Devin Outposts搬上NVIDIA Brev,让Devin能直接动用GPU来定位训练bug、检查显存状态,不用自己搭环境。
01:10
01:10官方一手GitHub Blog@Jacklyn Carroll
本文介绍如何使用GitHub Copilot的Canvases功能将AI转化为交互式工作空间。Canvases支持可视化信息、探索工作流,帮助用户在复杂任务中直接操作。通过拖拽组件,开发者可以快速搭建数据处理界面。
推荐理由:GitHub Copilot的Canvases让AI变成能拖拽的工作区,可视化数据、梳理工作流,做复杂任务挺顺手。
01:06
01:06GitHub@github
72°
GoogleAI 的 Gemini 3.6 Flash 现已正式推出,正在 GitHub Copilot 中逐步上线。该模型专为 Web 和应用程序开发、编码以及代理任务设计。测试表明,在编码和代理工作流中,其任务完成率高于 Gemini 3.5 Flash,且 token 效率更优。用户可以在 GitHub Copilot 或 VS Code 中体验。
事件专题

推荐理由:Google 新模型 Gemini 3.6 Flash 正式上线,直接在 GitHub Copilot 里用。比上一代 3.5 Flash 任务完成率更高,token 更省,写代码和做智能体任务更高效。
7月21日
23:41
23:41官方账号LangChain@LangChainAI
精选
LangChain 发布了一个 tracing 插件,能将每个 @cursor_ai 代理会话转换为 LangSmith 中的结构化 trace,包含模型运行、每个工具调用以及嵌套子代理工作。附件会被恢复并内联渲染。这是系列视频的第三个,之前有 Claude Code 和 Codex 的 trace,三者使用相同 schema,可在一个地方对比。
事件专题

推荐理由:想对比 Cursor、Claude Code、Codex 的代理行为?LangChain 出了个插件,把它们的 trace 统一到 LangSmith 里,方便你直接看模型和工具调用链。
23:03
23:03官方账号阿里通义 Qwen@Alibaba_Qwen
Qwen3.8-Max-Preview模型参数达2.4万亿,在Coding和Cowork基准上取得显著提升。该模型运行于Qoder的智能体核心,能自主执行长时间、端到端的任务。目前Qoder提供高达98%的折扣,价格从0.5x降至0.01x。
推荐理由:Qwen出了个2.4万亿参数的新模型,在编码和协作能力上很强,而且现在Qoder上打98%折扣,做长周期任务你可以直接甩手不盯着。
21:09
21:09官方账号Simon Willison’s Weblog博客/媒体
Anthropic的Claude Code团队在AI Engineer World's Fair上分享了开发经验。Claude Tag协作工具已完成65%的产品工程PR。Fable 5模型已不再适合通过添加示例来优化系统提示。Claude Code系统提示规模减少了80%。团队内部公开协作文化是其成功关键。
事件专题

推荐理由:Anthropic工程师分享Claude Code和Fable的开发经验,告诉你他们如何使用自己的工具。
16:10
16:10AI Will@FinanceYF5
Kimi-K3在Arena AI前端代码竞技场获得1679分,超过Claude Fable 5的1631分。这是中国模型首次在该竞技场超越美国模型。上一次中国模型逼近该位置是2025年初的DeepSeek-R1。该结果由中国AI公司月之暗面推出。
事件专题

推荐理由:Kimi-K3在代码竞技场拿了1679分,比Claude Fable 5高48分,中国模型第一次赢美国模型,可以看看。
12:45
12:45Sahil Lavingia@shl
Sahil Lavingia 表示其公司中 AI 编程助手 Devin 已承担 41% 的 Pull Request 编写工作。人类开发者负责决定构建内容并审查所有合并请求,但 AI 应尽可能多地编写代码。Lavingia 预计到明年底 Devin 将负责 80% 的 PR。

推荐理由:Sahil Lavingia 分享了他公司用 Devin 写代码的真实数据:41% 的 PR 由 AI 完成,明年还要翻倍。AI 编码已经不是概念了。
05:09
05:09elvis@omarsar0
精选
Cursor团队使用多个AI代理从835页手册重建SQLite的Rust版本,通过100%测试集。成本因模型组合不同而相差15倍。实践建议:用前沿模型做分解和架构设计,用便宜模型执行具体实现。注意代理协调中的偏差和失败。
事件专题

推荐理由:Cursor团队实战分享:如何搭配不同模型,用最小成本完成高难度编程任务,成本能差15倍。
02:13
7月20日
21:12
21:12官方账号阿里通义 Qwen@Alibaba_Qwen
阿里巴巴Qwen团队发布Qwen3.8-Max-Preview的最新版本,在多项能力上取得广泛进步,尤其在Web前端任务上有显著提升。该模型仍处于每日迭代中,团队邀请用户测试并反馈问题。未来计划发布更强大的正式版,并开源模型权重。
推荐理由:Qwen3.8预览版每天都在进化,这次Web前端进步特别大,写网页生成代码的好工具,快去试试吧。