8月14日
02:20
02:20官方账号Perplexity@perplexity_ai
精选
Perplexity 发布了两批 Search SDK 更新,用于 Computer 环境。更新后,模型执行可靠性从 81.9% 提升到 92.6%。更高的可靠性让模型能更稳定地完成动作编排。该更新强调 SDK 的形态直接决定了模型的调用能力。

推荐理由:Perplexity 把 Search SDK 的执行可靠性从 81.9% 拉到 92.6%,做智能体编排的更稳了。
02:16
02:16Harrison Chase@hwchase17
精选
LangChain创始人Harrison Chase在红杉活动上提出智能体由框架、模型和上下文三部分组成。他认为若使用场景偏离模型训练分布,越应自建框架。他验证了LangSmith Engine的评估功能,并展示了如何通过追踪、数据飞轮优化性能。视频中还讨论了为何可观测性常被低估。

推荐理由:红杉活动上,LangChain创始人聊了智能体三件套:框架、模型、上下文。他说越偏离模型训练数据,越该自己造框架。还演示了LangSmith Engine怎么做评估。
02:13
02:13Suhail@Suhail
X用户Suhail发帖称,因一系列'疯狂事件'已完全停用Anthropic模型两周。他认为模型没有长期忠诚度,忠诚度为零,用户可随时更换。该帖目前获19条回复、122个赞和6045次浏览。
事件专题

推荐理由:Suhail发帖吐槽Anthropic模型,称已两周不用,觉得模型没忠诚度,看看他到底撞上什么事。
02:11
02:11bolt.new@boltdotnew
Bolt官方推特发布消息,宣称语音输入比打字更快。用户可以随意说出不成熟的想法,系统会自动清理。Bolt会去除“嗯”“啊”等语气词和重复内容。用户无需提前整理思路,可以全盘倒出。
推荐理由:Bolt出了个有意思的功能,动嘴说想法就行,它会自动帮你删掉“嗯啊”那些废话,适合懒得打长文的人。
02:07
02:02
02:02官方账号Logan Kilpatrick@OfficialLoganK
Gemini 3.7 Flash 正式发布,API 价格较 3.6 Flash 降低 50%,优惠持续到年底。该模型在约三周内通过算法改进实现了显著的智能提升。它已上线 API、AI Studio 和 Antigravity 等平台。官方强调其运行速度很快。

推荐理由:Gemini 3.7 Flash 来了,比 3.6 Flash 便宜一半,速度更快,想用 API 的可以试试。
01:56
01:49
01:49Google Gemini App@GeminiApp
82°
Gemini Spark 已切换至 Gemini 3.7 Flash 模型。该个人智能体可把供应商信息汇总到 Sheets,也能起草谈判邮件。Gemini 3.7 Flash 改进了对 Google Workspace 应用的工具调用能力,让指令执行更精准。相关更新已通过 Gemini App 推送。
推荐理由:Gemini 的 Spark 换上了 3.7 Flash,整供应商清单、写谈判邮件都更准了,和 Workspace 联动也更顺手。
01:47
01:47lmarena.ai@lmarena_ai
Code Arena 推出 WebDev 排行榜,用于展示各模型在网页开发任务上的表现。WebDev 排行榜已通过 arena.ai 向公众开放,支持查看完整排名。Code Arena 的 WebDev 榜单为开发者在挑选模型时提供了直接对比。
推荐理由:Code Arena 搞了个 WebDev 排行榜,做网页开发选模型时可以参考排名,不用自己瞎试了。
01:45
01:43
01:43lmarena.ai@lmarena_ai
83°
xAI 的 Grok-4.6 (High) 在 Code Arena 的 WebDev 榜单以 1630 分升至第五名,超过 Claude Fable 5 的 1627 分和 GPT-5.6 Sol xHigh 的 1622 分。相比 Grok 4.5 的 1553 分(第13位),Grok-4.6 得分提升明显。目前这三款模型分差仅 4 至 9 分,分别排在第五至第七名。
事件专题

推荐理由:Grok-4.6 刚发布就把网页开发能力冲进第一梯队,分数压过 Claude 和 GPT 的最新版,差距只有个位数,写代码的可以关注下。
01:38
01:38官方账号Replit@Replit
精选
Replit Design 是 Replit 推出的新一代设计产品,旨在为 AI 时代重塑设计流程。该产品面向所有用户,相关介绍已发布在官方推文及 replit.com/design 页面。Replit 团队表示,当大家都在做同样的事情时,他们选择构建下一个方向。
推荐理由:Replit 发布 Replit Design,要在 AI 时代重做设计流程。别人做相同的,他们做不同的。官网已上线。
01:36
01:36官方账号Cursor@cursor_ai
Cursor 的 Builds 功能让 Agent 更稳定、也更容易调试。当一次新的构建失败时,它不会上线运行。Agent 会继续基于上次成功的构建工作,同时开发者可在后台进行调试。
事件专题

推荐理由:Cursor 这波 Builds 功能不错,构建失败不会上线,Agent 自动用上次成功版本继续干活,你专心调试就行。
01:35
01:35官方账号Cursor@cursor_ai
精选
Cursor发布新功能Builds,旨在优化云端Agent的启动性能。Faire、Headway和Descript等客户反馈,Agent启动时间从分钟级降至秒级。这些客户正越来越信任云端Agent自主执行端到端任务。具体机制可参考cursor.com/blog/builds。
事件专题

推荐理由:Cursor的Builds让Agent启动从分钟级变秒级,Faire等客户都在用,跑端到端更省心。
01:34
01:34官方账号Cursor@cursor_ai
精选
Cursor 的 Cloud agents 现已将启动速度提升 3 倍,能够接手从开始到结束的复杂长期任务。这一性能提升来自 build——Cursor 在后台持续预生成的即用开发环境,且不额外收费。用户无需等待环境配置,可直接分派更庞大的自动化任务。
事件专题

推荐理由:Cursor 把云 agent 启动提速到原来的 3 倍,靠后台自动准备好的 build 环境,不用多花钱就能跑长任务,挺实用。
01:32
01:32Fireworks AI@FireworksAI_HQ
精选
Fireworks AI 将 Anthropic 的 J-Lens 探针部署到开源模型 Kimi K3 和 Qwen 3.5-9B 上。通过检查模型的内部状态,发现它们在生成首个 token 之前就已布置好对应词汇。相关结果发布在 Fireworks 的 J-Lens 研究博客页面。
事件专题

推荐理由:Fireworks 把 Anthropic 的 J-Lens 探针装到 Kimi K3 和 Qwen 3.5-9B 上,发现模型在蹦出第一个 token 前就把词准备好了。看内部状态搞可解释性,挺有意思。
01:26
01:20
01:19
01:19官方账号OpenAI@OpenAI
83°
OpenAI 预览 GPT-5.6 Sol 的 Ultrafast 模式,速度最高提升至 14 倍。该模式首先在 OpenAI API 中面向一组精选客户推出,并随着容量增长向更多企业开放。官方尚未公布定价与全面开放时间。
事件专题

推荐理由:OpenAI 出了个 GPT-5.6 Sol 极速版,快 14 倍,先在 API 给一小部分客户用,后面会铺开。
01:18
00:16

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。