8月21日
02:13
02:13官方账号LangChain@LangChainAI
精选
LangChain 将于 8 月 27 日在 Sunnyvale 举办 Building Agents with Agents 路演活动。活动包含 @hwchase17 的主题演讲,介绍智能体开发现状和趋势架构。Expedia 机器学习总监 Mani Najmabadi 将分享其智能体构建经验。现场将举办两个工作坊,分别讲解如何使用 agent harnesses(Deep Agents)和 LangSmith Engine 来构建和优化智能体。

推荐理由:LangChain 下周四在 Sunnyvale 办活动,有 Expedia 工程师分享智能体实战,还有两个工作坊教你用 Deep Agents 和 LangSmith Engine,想学智能体开发的可以看看。
01:49
01:41
01:41lmarena.ai@lmarena_ai
精选
Meta 发布了 Muse Spark 1.2 (xHigh) 模型。该模型在 Agent Arena 基准测试中实现了 +2.1% 的净提升。相比前代 Muse Spark 1.1,其净提升分数从 0.9% 提升至 2.1%。在 Bash Recovery 任务上,性能从 +5.9% 提升到 +11.4%。

推荐理由:Meta 刚刚发布了 Muse Spark 1.2 (xHigh),在 Agent Arena 上的净提升分数从 0.9% 提升到了 2.1%,Bash Recovery 任务直接翻倍,比前代强了不少。
01:37
01:37lmarena.ai@lmarena_ai
Agent Arena 排行榜衡量模型在数百万个真实世界、长周期任务中的表现。模型可使用网络搜索、文件系统和终端工具完成复杂工作流。该榜单通过因果追踪方法,衡量模型相对于平均模型的结果表现。
推荐理由:看看 arena.ai 上新出的 Agent Arena 排行榜,它用真实任务测试模型,还能用工具,比普通测试更实用。
01:35
01:35官方账号LangChain@LangChainAI
LangChain 与 Fireworks 将于 8 月 25 日举办工作坊,教授如何训练自定义评估模型。该工作坊将介绍如何利用 LangSmith 优化智能体性能。工作坊还将探讨人类在环评估的成本与 LLM 评估的偏见问题。
推荐理由:LangChain 和 Fireworks 要办个线下工作坊,教你用 LangSmith 训练自己的评估模型,解决智能体优化问题。
01:29
01:29官方一手@OpenAIDevs@OpenAIDevs
78°
ChatGPT Pro、Business 和 Enterprise 用户可在 Mac 上使用 Computer History 功能。该功能可让 ChatGPT 记住用户在应用和网站上的活动。Computer History 能为 ChatGPT 提供更丰富的上下文,帮助其理解工作模式并建议重复性任务的技能或计划。
事件专题

推荐理由:OpenAI 给 ChatGPT Pro、Business 和 Enterprise 用户上了个新功能,能让它记住你之前在电脑上干了啥,下次聊天不用再重复解释背景了。
01:16
01:16宝玉@dotey
Claude Code 最新版本上线了一个特别讨厌的功能,频繁给其他正在运行的 session 发消息。该功能默认开启,用户至今未找到关闭选项。它会导致早已结束且无缓存的历史会话被意外唤起,造成 token 消耗激增。

推荐理由:Claude Code 新版上线了个烦人的跨 Session 通知功能,默认开启还关不掉,会把旧会话全唤醒,token 消耗飞起。
01:12
01:05
01:05shao__meng@shao__meng
精选
Harness 是让模型成为智能体的核心组件。它包含四个部分:系统提示、工具、智能体循环和模型翻译层。智能体循环是行为骨架,模型在循环中自主决定是否重做、何时收尾。开源项目 Pi 已被用户共享 5000+ 扩展,可本地运行。
推荐理由:Earendil 的文章解释了 Harness 是什么,它能让模型变成智能体。它有四个核心部分,开源项目 Pi 已被共享 5000+ 扩展,可本地运行,让你拥有自己的智能体。
01:02
01:02elvis@omarsar0
AI智能体工作流的核心在于与智能体协作、验证其结果,并将其编码为可复用的技能或验证器。领域专业知识通过人工验证形成巨大护城河,不应无偿分享。在利用AI处理复杂问题时,需认识到当前AI模型的“智能”和适应能力仍显原始。人机交互关系是真正的护城河,也是价值与发现的来源。
推荐理由:作者强调,与AI智能体协作并验证其结果,将经验转化为可复用技能,才是真正的护城河。别让AI取代你的领域知识,而是用它处理重复任务,同时保持自己的判断力。
00:44
00:40
00:40官方一手AWS Machine Learning Blog@Nikhil Jha
精选
AWS 专业服务团队使用基于 Amazon Bedrock AgentCore 的多智能体框架,自动化企业云迁移全流程。该框架中的专用 AI 智能体负责发现、基础设施即代码生成、组合治理和迁移后操作。此举将基础设施即代码的开发时间从数周缩短至数分钟。
事件专题

推荐理由:AWS 用 Bedrock AgentCore 做了个能自动完成企业云迁移的智能体,从几周的工作量缩到几分钟,比传统方法快多了。
00:39
00:39官方一手AWS Machine Learning Blog@Kristine Pearce
精选
AWS 发布了关于企业级智能体扩展模式的系列文章第二篇。文章探讨了机器学习团队如何在多框架、多模型、多供应商的复杂环境中运营多个智能体系统。核心是介绍让这些系统协同扩展的原则,同时保持灵活性并避免供应商锁定。
推荐理由:AWS 讲了企业如何搭建不绑定特定厂商的智能体系统。他们分享了在复杂环境中让多个智能体协同工作的原则,对想构建自己智能体生态的团队很有参考价值。
00:38
00:38官方一手AWS Machine Learning Blog@Sandesh Swamy
精选
Amazon Bedrock AgentCore 新增 Policy 功能,允许团队为 AI 智能体设置行为约束。该功能支持将自然语言编写的策略文档转换为正确的 Dogwood 策略。新功能包含时间限制等控制项,并提供了示例和最佳实践。
事件专题

推荐理由:AWS 在 Bedrock AgentCore 里加了个 Policy 功能,能把自然语言写的规则变成代码,还能加时间限制,帮你管好 AI 智能体别乱跑。
00:32
00:32Qdrant@qdrant_engine
精选
Tina Sharma使用Qdrant构建语义缓存,将相同语义的不同表述问题识别并复用已有响应。该方案在基准测试中实现了57.1%的缓存命中率。缓存命中时,响应时间约为15毫秒,并减少了55.7%的token消耗。文章比较了单向量与多向量检索在语义缓存中的表现。

推荐理由:Qdrant教你用语义缓存,让AI智能体不用重复回答问题。实测57.1%命中率,响应快15ms,还省55.7% token,比直接调用LLM强多了。
00:13
00:13官方一手AWS Machine Learning Blog@Marc Trimuschat
精选
AWS 推出向量解决方案,无需独立向量数据库或数据迁移。该方案包含六项专用服务。文章提供了选择合适引擎的决策框架。内容还包含客户案例证明。
推荐理由:AWS 把向量搜索直接集成到数据库和存储服务里了,不用再单独搞个向量数据库,能帮你直接在数据所在的地方构建智能体。
00:05
00:05elvis@omarsar0
精选
该论文分析了大量公开的智能体后训练轨迹。研究发现,智能体在第一步就锁定了训练策略,后续仅进行局部调整。论文尝试了三种改进方法:经验驱动的脚手架提升了GSM8K和HumanEval的分数,但策略仍保持冻结。人类指导能改变初始选择,但训练开始后智能体又回到局部循环。额外推理计算对简单任务有效,对最难任务几乎无效。
事件专题

推荐理由:这篇论文测试了智能体能否训练其他智能体,发现它们在第一步就锁定了策略,后续改进效果有限。作者尝试了三种方法,但智能体仍缺乏在执行中重新考虑策略的能力。
8月20日
23:38
23:38宝玉@dotey
Together AI 工程师哈桑分享了用智能体设计 UI 的经验。他开发了名为 Hallmark 的 design skill,将 AI 常见的“slop 套路”列为“别这么干”的规则喂给模型。他建议给智能体提供参考图和截图,并使用更长的提示词。他提到 GLM 5.2 的效果与 Opus 几乎分不出来,但速度更快。
推荐理由:Together AI 工程师哈桑分享了用智能体设计 UI 的经验,他做了个叫 Hallmark 的 design skill,把 AI 常见的“slop 套路”列为“别这么干”的规则喂给模型,效果很好。
23:05
23:05IT之家博客/媒体
阿里巴巴发布2027财年第一财季报告,营业总收入2689.53亿元,同比增长9%。归母净利润105.37亿元,同比下降76%。AI云与算力服务收入达到484.37亿元,同比增长45%。公司发布新一代旗舰基础模型Qwen3.8-Max,拥有2.4万亿总参数并开放权重。
推荐理由:阿里巴巴发了财报,AI业务收入涨了45%,还发布了新模型Qwen3.8-Max,虽然净利润降了76%,但AI这块增长挺猛的。
23:05
23:05
23:05
23:05
23:05官方账号Decoder@Maximilian Schreiner
78°
图灵奖得主理查德·萨顿称合成数据是扩展大语言模型的“大错误”。他认为世界是无限复杂的,任何模拟都只是“微观的”。人类专业知识会成为瓶颈,阻碍真正的扩展。萨顿的替代方案是让智能体从自身经验中持续学习,而不是依赖冻结的模型。

推荐理由:图灵奖得主萨顿说合成数据是扩展大模型的“大错误”,他认为世界太复杂,应该让智能体从真实经验中学习。
23:04
23:04
23:04
23:04官方账号LangChain@LangChainAI
精选
LATAM航空的Concierge智能体最初将13%的乘客消息判定为超出范围。团队审查生产数据后发现,其中95%是真实的乘客需求。通过增加一名客户关怀专员,他们将超出范围率降至1%,并将回头率提高了6%。
推荐理由:LATAM航空发现他们智能体13%的请求被误判,通过增加人工专家,把误判率降到1%,还提升了6%的回头率。看看他们怎么用生产数据优化智能体的。
23:04
23:04IT之家博客/媒体
沙特 HUMAIN 预告了 Horizon Ultra 笔记本电脑。该设备搭载高通骁龙 X2 Elite 处理器。其操作系统以“意图”为核心,面向代理式 AI 时代。产品将于 8 月 31 日至 9 月 3 日在 LEAP 2026 大会上展示。

推荐理由:沙特 HUMAIN 要发笔电了,用的是高通骁龙 X2 Elite 芯片,主打一个面向智能体的新系统,和普通笔记本不一样。
23:04
23:04shao__meng@shao__meng
精选
CopilotKit 团队发布了开源智能体 OpenBot。OpenBot 基于 AG-UI 协议,支持智能体与用户界面的交互。每个 Bot 拥有独立的虚拟电脑环境,可进行网页操作。Bot 能返回 React 组件,实现生成式 UI。
事件专题

推荐理由:CopilotKit 团队开源了他们的智能体 OpenBot,它能让 AI 像同事一样工作,还能操作电脑和生成界面,和 Grok Bot 类似但可以自己部署。
23:04
23:03
23:03
23:03
23:03IT之家博客/媒体
银河通用发布首款双足机器人 Galbot ET1“星仔”。该机器人宣称搭载银河星脑,具备实时互动和语音动作实时生成能力。视频显示,星仔能完成手撑地、倒立等高难度街舞动作,并与真人舞者同步。其背后是世界最顶级的运控模型及数据基建,具备自主学习能力。

推荐理由:银河通用发布了首款双足机器人“星仔”,能跳街舞、手撑地、倒立,还能和真人同步,号称是全球首个具备自主学习能力的物理智能体。
15:05
15:05IT之家博客/媒体
Waymo 将 Gemini AI 助手整合进 Ojai 自动驾驶出租车,乘客可通过语音让 Gemini 调节车内温度;Ojai 是 Waymo 打造的网约车自动驾驶出租车,已开放多地服务;Gemini 与 Waymo Driver 独立运行,无法直接操控车辆行驶,仅能请求靠边。
事件专题

推荐理由:Waymo 把 Gemini 整合进 Ojai 出租车上,乘客能语音调温、查周边,以后坐这车用 AI 助手更方便。
12:55
12:55Hailuo AI@Hailuo_AI
海洛AI的MiniMax H3在Design工具中测试后,成功制作了动漫PV;该工具的Agent帮助用户分步处理流程,而非仅提供单条生成结果;从创意到最终成果,全程协助用户完成创作。
事件专题

推荐理由:海洛AI的这个设计工具用MiniMax H3做动漫PV,能一步步帮你处理流程,比普通生成工具更帮忙呢。
10:18
10:18官方账号arXiv cs.AI@Ramneet Kaur, Pradyumna Chari, Ramesh Raskar, Jugad Singh, Sumit Kumar Jha, Anirban Roy
Qwen3-0.6B模型在多代理拍卖场景中,通过新框架监测潜在隐蔽协作;该框架对同质化代理的检测准确率达0.993,异质化组合达0.854;测试显示对小范围竞拍者监测负载小,全白盒干预能恢复出价分布并降低合谋行为47.3个百分点。
推荐理由:Qwen3推出了VLA框架,用来监测多代理潜在通信,在小范围拍卖里表现好,你可以去了解下。
10:17