02:13官方账号LangChain@LangChainAI精选LangChain 将于 8 月 27 日在 Sunnyvale 举办 Building Agents with Agents 路演活动。活动包含 @hwchase17 的主题演讲,介绍智能体开发现状和趋势架构。Expedia 机器学习总监 Mani Najmabadi 将分享其智能体构建经验。现场将举办两个工作坊,分别讲解如何使用 agent harnesses(Deep Agents)和 LangSmith Engine 来构建和优化智能体。行业LangChain智能体agent harnesses推荐理由:LangChain 下周四在 Sunnyvale 办活动,有 Expedia 工程师分享智能体实战,还有两个工作坊教你用 Deep Agents 和 LangSmith Engine,想学智能体开发的可以看看。原文稍后读已读值得跟进有用关注 LangChain
01:49Amjad Masad@amasadReplit 新 Free Mode 速度获赞。用户 Daniel Matteson 使用该模式让 AI 生成一个有 200 名村民的中世纪城镇模拟。整个生成过程耗时不到 6 分钟。该功能完全免费。AI产品ReplitFree Mode智能体推荐理由:Replit 的 Free Mode 能免费生成 200 个村民的中世纪城镇,6 分钟搞定,速度超快。原文稍后读已读值得跟进有用关注 Replit
01:41lmarena.ai@lmarena_ai精选Meta 发布了 Muse Spark 1.2 (xHigh) 模型。该模型在 Agent Arena 基准测试中实现了 +2.1% 的净提升。相比前代 Muse Spark 1.1,其净提升分数从 0.9% 提升至 2.1%。在 Bash Recovery 任务上,性能从 +5.9% 提升到 +11.4%。AI模型Muse SparkMetaAgent Arena推荐理由:Meta 刚刚发布了 Muse Spark 1.2 (xHigh),在 Agent Arena 上的净提升分数从 0.9% 提升到了 2.1%,Bash Recovery 任务直接翻倍,比前代强了不少。原文稍后读已读值得跟进有用关注 Muse Spark
01:37lmarena.ai@lmarena_aiAgent Arena 排行榜衡量模型在数百万个真实世界、长周期任务中的表现。模型可使用网络搜索、文件系统和终端工具完成复杂工作流。该榜单通过因果追踪方法,衡量模型相对于平均模型的结果表现。AI模型Agent Arenaarena.ai智能体推荐理由:看看 arena.ai 上新出的 Agent Arena 排行榜,它用真实任务测试模型,还能用工具,比普通测试更实用。原文稍后读已读值得跟进有用关注 Agent Arena
01:35官方账号LangChain@LangChainAILangChain 与 Fireworks 将于 8 月 25 日举办工作坊,教授如何训练自定义评估模型。该工作坊将介绍如何利用 LangSmith 优化智能体性能。工作坊还将探讨人类在环评估的成本与 LLM 评估的偏见问题。技巧LangChainFireworks智能体推荐理由:LangChain 和 Fireworks 要办个线下工作坊,教你用 LangSmith 训练自己的评估模型,解决智能体优化问题。原文稍后读已读值得跟进有用关注 LangChain
01:29官方一手@OpenAIDevs@OpenAIDevs78°ChatGPT Pro、Business 和 Enterprise 用户可在 Mac 上使用 Computer History 功能。该功能可让 ChatGPT 记住用户在应用和网站上的活动。Computer History 能为 ChatGPT 提供更丰富的上下文,帮助其理解工作模式并建议重复性任务的技能或计划。AI产品ChatGPTOpenAIComputer History10 个信源在谈事件专题推荐理由:OpenAI 给 ChatGPT Pro、Business 和 Enterprise 用户上了个新功能,能让它记住你之前在电脑上干了啥,下次聊天不用再重复解释背景了。原文稍后读已读值得跟进有用关注 ChatGPT
01:16宝玉@doteyClaude Code 最新版本上线了一个特别讨厌的功能,频繁给其他正在运行的 session 发消息。该功能默认开启,用户至今未找到关闭选项。它会导致早已结束且无缓存的历史会话被意外唤起,造成 token 消耗激增。AI产品ClaudeClaude Code智能体推荐理由:Claude Code 新版上线了个烦人的跨 Session 通知功能,默认开启还关不掉,会把旧会话全唤醒,token 消耗飞起。原文稍后读已读值得跟进有用关注 Claude
01:12elvis@omarsar0Lindy 推出 Chrome 扩展,将智能体功能引入邮箱。该扩展可高亮重要邮件、基于记忆草拟回复、并学习自动标记邮件。Lindy 的记忆功能被评价为相当不错。AI产品LindyChrome 扩展智能体推荐理由:Lindy 推出 Chrome 扩展,能帮你自动整理邮箱、草拟邮件,还能学习你的风格。原文稍后读已读值得跟进有用关注 Lindy
01:05shao__meng@shao__meng精选Harness 是让模型成为智能体的核心组件。它包含四个部分:系统提示、工具、智能体循环和模型翻译层。智能体循环是行为骨架,模型在循环中自主决定是否重做、何时收尾。开源项目 Pi 已被用户共享 5000+ 扩展,可本地运行。技巧Harness智能体Pi推荐理由:Earendil 的文章解释了 Harness 是什么,它能让模型变成智能体。它有四个核心部分,开源项目 Pi 已被共享 5000+ 扩展,可本地运行,让你拥有自己的智能体。原文稍后读已读值得跟进有用关注 Harness
01:03Y Combinator@ycombinator精选Y Combinator Paper Club 本周聚焦数据。随着模型在任务和语言上扩展,关于训练和评估的旧假设开始失效。专家们讨论了训练数据、基准测试和多语言预训练的挑战与前沿。Vincent Sunn 谈论了智能体基准测试的艺术与科学。Volokhuleshov 介绍了 Inception 扩散语言模型。Shayne Redford 讲解了 ATLAS 多语言模型的实用缩放定律。论文Y CombinatorPaper Club智能体推荐理由:Y Combinator Paper Club 请了三位专家,分别讲了智能体基准测试、扩散语言模型和实用缩放定律,都是数据相关的前沿话题。原文稍后读已读值得跟进有用关注 Y Combinator
01:02elvis@omarsar0AI智能体工作流的核心在于与智能体协作、验证其结果,并将其编码为可复用的技能或验证器。领域专业知识通过人工验证形成巨大护城河,不应无偿分享。在利用AI处理复杂问题时,需认识到当前AI模型的“智能”和适应能力仍显原始。人机交互关系是真正的护城河,也是价值与发现的来源。技巧智能体提示词工程AI安全推荐理由:作者强调,与AI智能体协作并验证其结果,将经验转化为可复用技能,才是真正的护城河。别让AI取代你的领域知识,而是用它处理重复任务,同时保持自己的判断力。原文稍后读已读值得跟进有用关注 智能体
00:44Fireworks AI@FireworksAI_HQHarvey公司发布了其首个AI模型Tenet。该模型是法律AI领域的一个里程碑。Harvey与Fireworks AI共同开发了Tenet模型。该模型为律所构建专用智能奠定了基础。AI模型HarveyTenet法律AI推荐理由:Harvey刚发布了他们的第一个模型Tenet,这是法律AI领域的一个里程碑,和Fireworks AI一起做的,能让律所构建自己的专用智能。原文稍后读已读值得跟进有用关注 Harvey
00:40官方一手AWS Machine Learning Blog@Nikhil Jha精选AWS 专业服务团队使用基于 Amazon Bedrock AgentCore 的多智能体框架,自动化企业云迁移全流程。该框架中的专用 AI 智能体负责发现、基础设施即代码生成、组合治理和迁移后操作。此举将基础设施即代码的开发时间从数周缩短至数分钟。AI产品Amazon BedrockAgentCore云迁移1 个信源在谈事件专题推荐理由:AWS 用 Bedrock AgentCore 做了个能自动完成企业云迁移的智能体,从几周的工作量缩到几分钟,比传统方法快多了。原文稍后读已读值得跟进有用关注 Amazon Bedrock
00:39官方一手AWS Machine Learning Blog@Kristine Pearce精选AWS 发布了关于企业级智能体扩展模式的系列文章第二篇。文章探讨了机器学习团队如何在多框架、多模型、多供应商的复杂环境中运营多个智能体系统。核心是介绍让这些系统协同扩展的原则,同时保持灵活性并避免供应商锁定。行业agentic AIAWS智能体推荐理由:AWS 讲了企业如何搭建不绑定特定厂商的智能体系统。他们分享了在复杂环境中让多个智能体协同工作的原则,对想构建自己智能体生态的团队很有参考价值。原文稍后读已读值得跟进有用关注 agentic AI
00:38官方一手AWS Machine Learning Blog@Sandesh Swamy精选Amazon Bedrock AgentCore 新增 Policy 功能,允许团队为 AI 智能体设置行为约束。该功能支持将自然语言编写的策略文档转换为正确的 Dogwood 策略。新功能包含时间限制等控制项,并提供了示例和最佳实践。AI产品Amazon BedrockDogwood智能体1 个信源在谈事件专题推荐理由:AWS 在 Bedrock AgentCore 里加了个 Policy 功能,能把自然语言写的规则变成代码,还能加时间限制,帮你管好 AI 智能体别乱跑。原文稍后读已读值得跟进有用关注 Amazon Bedrock
00:35Lenny Rachitsky@lennysanLenny Rachitsky 创建了一个 Grok Bot,该 Bot 基于其 500 多个播客和新闻通讯内容训练。用户可以将其视为产品、策略、增长和职业顾问。Bot 可回答诸如“如何找到第一批 1000 名用户”等问题。用户需通过 MCP 连接器 mcp.lennysdata.com/mcp 来启用该 Bot。AI产品GrokLenny RachitskyMCP/工具推荐理由:Lenny 用 Grok 做了个能回答他所有内容的 Bot,你问它怎么找用户、怎么升职,比看文章快多了。原文稍后读已读值得跟进有用关注 Grok
00:32Qdrant@qdrant_engine精选Tina Sharma使用Qdrant构建语义缓存,将相同语义的不同表述问题识别并复用已有响应。该方案在基准测试中实现了57.1%的缓存命中率。缓存命中时,响应时间约为15毫秒,并减少了55.7%的token消耗。文章比较了单向量与多向量检索在语义缓存中的表现。技巧Qdrant语义缓存智能体推荐理由:Qdrant教你用语义缓存,让AI智能体不用重复回答问题。实测57.1%命中率,响应快15ms,还省55.7% token,比直接调用LLM强多了。原文稍后读已读值得跟进有用关注 Qdrant
00:28Weaviate@weaviate_io精选可靠智能体RAG依赖控制信息如何到达模型、何时到达以及以何种形式到达。上下文工程分为5个相互关联的系统:1. 查询增强,用户输入混乱,需重写、扩展或分解查询以匹配检索系统。2. 检索,分块存在权衡,小分块提高精度但丢失上下文,大分块增加上下文但消耗更多窗口。3. 记忆,完整对话历史会产生噪音,长期记忆应存储在模型外部并定期维护。4. 工具,工具描述和选择消耗上下文,暴露过多 poorly described 工具会降低效率。5. 智能体,连接所有部分但会放大上游错误。技巧RAG智能体提示词工程推荐理由:Weaviate 分享了智能体RAG的5个关键系统,告诉你为什么优化提示词没用,以及如何真正控制信息流。原文稍后读已读值得跟进有用关注 RAG
00:13官方一手AWS Machine Learning Blog@Marc Trimuschat精选AWS 推出向量解决方案,无需独立向量数据库或数据迁移。该方案包含六项专用服务。文章提供了选择合适引擎的决策框架。内容还包含客户案例证明。AI产品AWS向量搜索智能体推荐理由:AWS 把向量搜索直接集成到数据库和存储服务里了,不用再单独搞个向量数据库,能帮你直接在数据所在的地方构建智能体。原文稍后读已读值得跟进有用关注 AWS
00:05elvis@omarsar0精选该论文分析了大量公开的智能体后训练轨迹。研究发现,智能体在第一步就锁定了训练策略,后续仅进行局部调整。论文尝试了三种改进方法:经验驱动的脚手架提升了GSM8K和HumanEval的分数,但策略仍保持冻结。人类指导能改变初始选择,但训练开始后智能体又回到局部循环。额外推理计算对简单任务有效,对最难任务几乎无效。论文智能体后训练GSM8K1 个信源在谈事件专题推荐理由:这篇论文测试了智能体能否训练其他智能体,发现它们在第一步就锁定了策略,后续改进效果有限。作者尝试了三种方法,但智能体仍缺乏在执行中重新考虑策略的能力。原文稍后读已读值得跟进有用关注 智能体
23:38宝玉@doteyTogether AI 工程师哈桑分享了用智能体设计 UI 的经验。他开发了名为 Hallmark 的 design skill,将 AI 常见的“slop 套路”列为“别这么干”的规则喂给模型。他建议给智能体提供参考图和截图,并使用更长的提示词。他提到 GLM 5.2 的效果与 Opus 几乎分不出来,但速度更快。技巧Hallmark智能体提示词工程推荐理由:Together AI 工程师哈桑分享了用智能体设计 UI 的经验,他做了个叫 Hallmark 的 design skill,把 AI 常见的“slop 套路”列为“别这么干”的规则喂给模型,效果很好。原文稍后读已读值得跟进有用关注 Hallmark
23:05IT之家(博客/媒体)精选阿里推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,涵盖移动端、电脑端、网页端及深度搜索环境。在移动端 MobileWorld 基准上得分 82.1%,超越 GPT-5.6 Sol、Claude Opus 4.8 等模型;真机基准 MobileWorld-Real 得分 92.2%,接近满分。电脑端 OSWorld-Verified 得分 79.5%,超越 GPT-5.5、Gemini 3.1 Pro 等模型。浏览器 & DeepSearch 方面,WebArena 得分 73.6%,位列所有对比模型第一。AI模型Qwen-UI-Agent阿里GUI智能体1 个信源在谈事件专题推荐理由:阿里刚发了 Qwen-UI-Agent,能直接操作手机电脑屏幕,移动端比 GPT-5.6 Sol 高 12 个点,还能在真实手机上跑任务,以后帮你自动查地址、订高铁、整理文件应该更靠谱了。原文稍后读已读值得跟进有用关注 Qwen-UI-Agent
23:05IT之家(博客/媒体)阿里巴巴发布2027财年第一财季报告,营业总收入2689.53亿元,同比增长9%。归母净利润105.37亿元,同比下降76%。AI云与算力服务收入达到484.37亿元,同比增长45%。公司发布新一代旗舰基础模型Qwen3.8-Max,拥有2.4万亿总参数并开放权重。行业阿里巴巴Qwen3.8-MaxAI云推荐理由:阿里巴巴发了财报,AI业务收入涨了45%,还发布了新模型Qwen3.8-Max,虽然净利润降了76%,但AI这块增长挺猛的。原文稍后读已读值得跟进有用关注 阿里巴巴
23:05量子位@林, 方舟WRC发布了一款名为“全栈AI”的智能助手。该产品号称能完成20多种家务任务。其售价为8.99万元人民币。AI产品WRC全栈AI智能体推荐理由:WRC刚发布了全栈AI,能做20多种家务,8.99万就能买回家,比很多同类产品能干更多活。原文稍后读已读值得跟进有用关注 WRC
23:05量子位@henryKimi K3在18个Agent自主科研任务中表现优异。该模型在Harness框架下运行,其性能接近OpenAI的GPT-4o。Kimi K3在多项基准测试中展现出强大的多模态理解能力。该模型在处理复杂科研任务时表现出色。AI模型Kimi K3GPT-4oHarness10 个信源在谈事件专题推荐理由:Kimi K3用Harness框架,在18个Agent科研任务里,性能快追上GPT-4o了,挺厉害的。原文稍后读已读值得跟进有用关注 Kimi K3
23:05IT之家(博客/媒体)78°OpenAI 正在开发让 AI 智能体像人类一样熟练操作电脑的能力。公司通过加入专门数据和训练流程来提升模型能力,包括使用真人示范数据集和强化学习。新模型能快速读取网页底层信息,而不仅是分析屏幕截图。目前该技术速度仍不及普通消费者期待,且存在安全风险,OpenAI 正在研究“确认策略”以平衡易用性与安全性。AI产品OpenAIChatGPT智能体10 个信源在谈事件专题推荐理由:OpenAI 正在让 ChatGPT 学会操作电脑,以后可能比你自己点鼠标还快。他们用了真人示范数据,还改了读取网页的方式,不过现在还慢,而且有安全风险。原文稍后读已读值得跟进有用关注 OpenAI
23:05官方账号Decoder@Maximilian Schreiner78°图灵奖得主理查德·萨顿称合成数据是扩展大语言模型的“大错误”。他认为世界是无限复杂的,任何模拟都只是“微观的”。人类专业知识会成为瓶颈,阻碍真正的扩展。萨顿的替代方案是让智能体从自身经验中持续学习,而不是依赖冻结的模型。行业Richard Sutton合成数据智能体推荐理由:图灵奖得主萨顿说合成数据是扩展大模型的“大错误”,他认为世界太复杂,应该让智能体从真实经验中学习。原文稍后读已读值得跟进有用关注 Richard Sutton
23:04techcrunch@Jagmeet Singh币安推出Agent OS,允许AI代理进行交易。该系统兼容ChatGPT、Claude Code和Cursor等工具。用户需自行负责管理这些AI代理。AI产品BinanceAgent OSChatGPT8 个信源在谈事件专题推荐理由:币安现在能让AI帮你交易了,但得你自己管着点。它支持ChatGPT、Claude这些工具,和传统交易软件不一样。原文稍后读已读值得跟进有用关注 Binance
23:04Viking@vikingmuteUISFX 网站是一个专门提供声音效果的库。该网站提供 12 种不同风格的声音。网站总共收录了 936 种声音。这些声音可用于 AI 智能体提示音。AI产品UISFX智能体提示音推荐理由:有人发现了一个叫 UISFX 的网站,里面有 936 种声音效果,可以用来给智能体做提示音,比一般网站精致。原文稍后读已读值得跟进有用关注 UISFX
23:04官方账号LangChain@LangChainAI精选LATAM航空的Concierge智能体最初将13%的乘客消息判定为超出范围。团队审查生产数据后发现,其中95%是真实的乘客需求。通过增加一名客户关怀专员,他们将超出范围率降至1%,并将回头率提高了6%。AI产品LATAM AirlinesConcierge智能体推荐理由:LATAM航空发现他们智能体13%的请求被误判,通过增加人工专家,把误判率降到1%,还提升了6%的回头率。看看他们怎么用生产数据优化智能体的。原文稍后读已读值得跟进有用关注 LATAM Airlines
23:04IT之家(博客/媒体)沙特 HUMAIN 预告了 Horizon Ultra 笔记本电脑。该设备搭载高通骁龙 X2 Elite 处理器。其操作系统以“意图”为核心,面向代理式 AI 时代。产品将于 8 月 31 日至 9 月 3 日在 LEAP 2026 大会上展示。AI产品HUMAINHorizon Ultra高通骁龙 X2 Elite推荐理由:沙特 HUMAIN 要发笔电了,用的是高通骁龙 X2 Elite 芯片,主打一个面向智能体的新系统,和普通笔记本不一样。原文稍后读已读值得跟进有用关注 HUMAIN
23:04shao__meng@shao__meng精选CopilotKit 团队发布了开源智能体 OpenBot。OpenBot 基于 AG-UI 协议,支持智能体与用户界面的交互。每个 Bot 拥有独立的虚拟电脑环境,可进行网页操作。Bot 能返回 React 组件,实现生成式 UI。AI产品OpenBotCopilotKit智能体1 个信源在谈事件专题推荐理由:CopilotKit 团队开源了他们的智能体 OpenBot,它能让 AI 像同事一样工作,还能操作电脑和生成界面,和 Grok Bot 类似但可以自己部署。原文稍后读已读值得跟进有用关注 OpenBot
23:04elvis@omarsar0在模拟咖啡电商场景中,智能体需追踪库存、采购、履约和客户需求。外部条件变化时,智能体需要调整计划。用户意图是逐渐显现的,任务会分阶段展开。AI模型智能体多模态AI安全推荐理由:Omar Sar0 发推指出,真实世界比封闭基准更难。智能体在模拟电商场景中,需要动态调整计划以应对变化。原文稍后读已读值得跟进有用关注 智能体
23:03官方账号Decoder@Maximilian Schreiner机器人初创公司 Generalist AI 发布了 GEN-1.5 模型。该模型能通过单次演示教机器人新任务。GEN-1.5 是一个通用型 AI 模型。AI模型GEN-1.5Generalist AI智能体推荐理由:Generalist AI 刚刚发布了 GEN-1.5,它能通过一次演示就教会机器人新任务,比传统方法更高效。原文稍后读已读值得跟进有用关注 GEN-1.5
23:03techcrunch@Ivan MehtaMeta 推出了一款新的 Mac 应用。该应用的核心功能是语音交互。Muse Spark 模型为该应用的听写功能提供支持。AI产品MetaMuse SparkMac推荐理由:Meta 新出的 Mac App,能用 Muse Spark 模型直接语音操控应用,不用打字了。原文稍后读已读值得跟进有用关注 Meta
23:03IT之家(博客/媒体)银河通用发布首款双足机器人 Galbot ET1“星仔”。该机器人宣称搭载银河星脑,具备实时互动和语音动作实时生成能力。视频显示,星仔能完成手撑地、倒立等高难度街舞动作,并与真人舞者同步。其背后是世界最顶级的运控模型及数据基建,具备自主学习能力。AI产品Galbot ET1银河通用双足机器人推荐理由:银河通用发布了首款双足机器人“星仔”,能跳街舞、手撑地、倒立,还能和真人同步,号称是全球首个具备自主学习能力的物理智能体。原文稍后读已读值得跟进有用关注 Galbot ET1
15:05IT之家(博客/媒体)Waymo 将 Gemini AI 助手整合进 Ojai 自动驾驶出租车,乘客可通过语音让 Gemini 调节车内温度;Ojai 是 Waymo 打造的网约车自动驾驶出租车,已开放多地服务;Gemini 与 Waymo Driver 独立运行,无法直接操控车辆行驶,仅能请求靠边。AI产品GeminiOjai自动驾驶出租车1 个信源在谈事件专题推荐理由:Waymo 把 Gemini 整合进 Ojai 出租车上,乘客能语音调温、查周边,以后坐这车用 AI 助手更方便。原文稍后读已读值得跟进有用关注 Gemini
12:55Hailuo AI@Hailuo_AI海洛AI的MiniMax H3在Design工具中测试后,成功制作了动漫PV;该工具的Agent帮助用户分步处理流程,而非仅提供单条生成结果;从创意到最终成果,全程协助用户完成创作。AI产品Hailuo_AIMiniMax_H3Design1 个信源在谈事件专题推荐理由:海洛AI的这个设计工具用MiniMax H3做动漫PV,能一步步帮你处理流程,比普通生成工具更帮忙呢。原文稍后读已读值得跟进有用关注 Hailuo_AI
10:18官方账号arXiv cs.AI@Ramneet Kaur, Pradyumna Chari, Ramesh Raskar, Jugad Singh, Sumit Kumar Jha, Anirban RoyQwen3-0.6B模型在多代理拍卖场景中,通过新框架监测潜在隐蔽协作;该框架对同质化代理的检测准确率达0.993,异质化组合达0.854;测试显示对小范围竞拍者监测负载小,全白盒干预能恢复出价分布并降低合谋行为47.3个百分点。AI模型Qwen3智能体多模态推荐理由:Qwen3推出了VLA框架,用来监测多代理潜在通信,在小范围拍卖里表现好,你可以去了解下。原文稍后读已读值得跟进有用关注 Qwen3
10:17量子位@量子位的朋友们华尔街对8款全球主流Agent开展实测,结果显示千问办公Agent在综合性能排名第一。该测试表明Agent商业化进程中成本成为关键考量因素之一。千问办公Agent通过对比其他7家产品展现出优势。AI产品Agent千问华尔街推荐理由:我朋友知道华尔街测了8款Agent,千问办公那款综合第一,对比其他产品它更优,值得看看。原文稍后读已读值得跟进有用关注 Agent