8月15日
00:13
00:13官方一手AWS Machine Learning Blog@Ayush Sharma
精选
AWS官方博客发布教程,演示如何将SageMaker AI上的OpenAI兼容端点与Bedrock AgentCore运行时结合,构建多智能体工作流。每个智能体可选择最适合其任务的模型。教程还展示了如何从SageMaker端点获取token级可观测性,这是Strands Agents默认不提供的。
事件专题

推荐理由:AWS官方教程,教你用SageMaker AI和Bedrock AgentCore搭多智能体流程,还能拿到token级监控,比Strands Agents默认的细致。
8月13日
18:13
18:13官方账号LangChain@LangChainAI
精选
LangChain 旗下 LangSmith 重构了 Dashboard 功能,支持将 KPI 与趋势图并排展示。用户可对比不同单位的指标,按模型或用户拆分 trace。新版 Dashboard 还允许添加备注并自由调整布局,便于调查和报告。
推荐理由:LangSmith 的 Dashboard 大改版,能把 KPI、趋势和 Trace 拆解放一起看,做报告方便多了。
8月8日
00:14
00:14官方账号LangChain@LangChainAI
LangChain基于LangSmith可观测性数据,分析了数十亿次智能体运行记录,推出LangSmith Signals系列报告。该系列将按具体数据展示开发者构建智能体的方式与趋势。目前官方仅发布预告,完整分析尚未公开。
推荐理由:LangChain用自家LangSmith的几十亿次运行数据,扒了扒开发者到底怎么搭智能体,后续报告值得蹲一下。
8月7日
13:15
13:15官方一手arXiv: DeepSeek@Fanzhe Wei, Li Liu, Ziyang Wang, Chenyu Wang
精选
论文提出覆盖四类注意力内存的统一运行时可观测性契约,用三个算子实例化到五个架构族的六种模型配置。契约将误差度量作为类型,度量不匹配时组合被拒绝,并自动降级为经验性证据。在1240万条读取回放和八路并发下验证风险账本,零违规。应用于DeepSeek-V4压缩KV原型时,定位到静默损坏的结构边界。
推荐理由:MetaSk团队发了个监控注意力内存的工具,能跨四类缓存统一检测,实测定位了DeepSeek-V4的静默损坏,还有Lean证明。
01:10
01:10官方一手AWS Machine Learning Blog@Claudio Mazzoni
精选
AWS发布新指南,教工程团队通过OpenTelemetry采集Codex编码代理的指标,并经本地Collector转发至Amazon CloudWatch。方案可按用户、团队和成本中心维度查看使用量与可靠性。文章包含配置步骤和架构示例,适用于已采用Codex并需要治理视图的团队。
推荐理由:想看清团队里Codex用得多不多、稳不稳?这篇教程教你用OpenTelemetry把数据接到CloudWatch,按人、按团队拆开看。
8月4日
7月31日
23:54
23:54官方一手AWS Machine Learning Blog@Joshua Lacy
文章介绍如何使用 Amazon Bedrock AgentCore Observability 监控生产智能体。借助 Amazon CloudWatch 仪表盘,可以定位长时运行会话中的性能瓶颈。通过 CloudWatch 日志和指标,还能诊断内存异常并优化配置。
推荐理由:如果你有智能体从demo上线后变慢,这篇AWS官方教程教你怎么用CloudWatch和AgentCore找瓶颈、查内存问题,实用。
12:51
12:51官方账号arXiv cs.AI@Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang, Raj Agrawal, Anish Agarwal, Raaz Dwivedi
ORCA-bench用一套运行六天的OpenTelemetry微服务系统,通过Prometheus、Jaeger和OpenSearch/Grafana接口暴露指标、日志和链路,共构造1079个值班根因分析任务。五个前沿智能体在Medium难度任务上最佳RCA准确率仅25.3%,Hard难度为10.0%。最弱模型在40%的故障报告中给出不合理根因;去掉源代码访问后所有指标下降。专家SRE对真值症状做了复核,LLM评判与人类评分加权kappa为0.90。
推荐理由:想看看编程Agent在真实值班场景有多靠谱?ORCA-bench给了1079个线上故障任务,最强模型也只答对四分之一。
7月22日
7月17日
23:21
6月30日
01:33
01:33官方一手AWS Machine Learning Blog@Joshua Lacy
精选
本文介绍如何使用Amazon Bedrock AgentCore的内置可观测性功能调试生产环境中的智能体故障。文章涵盖常见的故障模式,如无限循环和工具调用失败。通过追踪和指标分析智能体行为,并提供结构化工作流来解决问题。本文是两部分系列的第一部分,第二部分将讨论性能优化和内存管理。
推荐理由:AWS博客教你用Bedrock AgentCore内置观察功能排查生产智能体故障,比如无限循环和工具调用失败,省去自己搭建监控的麻烦。
6月20日
04:25
04:25AI Engineer@aiDotEngineer
AI Engineer World's Fair 将于2025年6月29日至7月2日在旧金山Moscone West举办。60多家金牌赞助商已确认参展,覆盖基础设施、推理、智能体、数据、评估和可观测性等六大领域。活动旨在展示完整的AI工程生态栈,从底层基础到上层应用。

推荐理由:AI工程师的年度盛会,60多个顶级赞助商齐聚一堂,覆盖从底层硬件到上层Agent的完整栈,值得去现场看看趋势。
6月17日
03:43
03:43官方账号LangChain@LangChainAI
LangSmith 新增代理拆解功能,可让开发者追踪 AI 代理在生产环境中的每一步决策。该功能帮助快速定位失败原因,并识别关键改进点。无需修改代码即可解析代理行为逻辑,实现持续优化。
推荐理由:LangSmith 新功能让你像拆玩具一样拆解 AI 代理,哪步走错了门清,生产环境调试超省心。
6月16日
14:11
14:11Harrison Chase@hwchase17
精选
开发者 Saurabh 强调,Agent 必须有可观测性。他用 LangGraph 做编排,LangSmith 做追踪、评估和回归测试。如果无法解释 Agent 为何给出某个回答,那就只是 demo 而非架构。他建议通过 tracing 捕获 prompt 和工具调用的全部上下文。
推荐理由:如果你在用 LangGraph 做 agent,这招能帮你从 demo 变成可交付的系统——关键是 LangSmith 的 trace 和 eval。
6月12日
04:40
04:40官方账号LangChain@LangChainAI
LangChain 推出 LangSmith Observability 功能,旨在帮助开发者实时监控和理解智能体(agent)的运行表现。该工具能够快速定位问题根源,提升调试效率。对于使用 LangChain 构建复杂智能体应用的团队来说,这解决了追踪和诊断性能瓶颈的痛点。目前该功能已可用,相关推文获得初步关注。
推荐理由:做智能体应用的开发者终于不用靠猜来排查问题了——LangSmith Observability 让实时性能追踪变得直观,建议用 LangChain 的团队直接试试。
6月11日
6月4日
6月2日
5月25日
12:45
12:45官方一手marktechpost@Sana Hassan
精选
本文是一篇教程,指导读者使用 Langfuse(一个开源 LLM 工程平台)构建完整的可观测性与评估管道。教程涵盖了追踪、提示管理、评分、数据集和实验等核心功能。它支持使用真实的 OpenAI 密钥或确定性模拟 LLM,让读者无需付费模型访问即可理解所有主要功能。文章提供了逐步实现的工作流程,适合希望系统学习 LLM 工程实践的开发者。
推荐理由:想系统掌握 LLM 应用的可观测性与评估?这篇教程用 Langfuse 手把手带你走通追踪、提示管理、评分和实验全流程,还支持模拟 LLM 免费用。做 LLM 工程或运维的团队值得收藏。
5月22日
08:06
08:06Notion@NotionHQ
Notion 发布了 Custom Agent Insights 功能,让用户能够实时查看智能体的每一次运行过程。该功能旨在解决智能体行为不透明的问题,提供完整的运行日志和可视化。目前该功能正在逐步推出,用户无需再猜测智能体在做什么。
事件专题

推荐理由:Notion 用户终于能看清智能体每一步操作了,做自动化工作流的团队可以直接用起来,减少调试时的盲猜。
5月19日