00:38官方一手AWS Machine Learning Blog@Vitaly Omelchenko佐治亚州立大学研究中心TReNDS基于Amazon Bedrock和开源Strands Agents SDK构建了智能体流水线。该流水线实时自动调查生产错误,将根因分析耗时从人工的15至30分钟压缩到60秒以内。系统利用Strands Agents SDK编排智能体,在Bedrock上调用大模型完成诊断。技巧Amazon BedrockTReNDSStrands Agents SDK推荐理由:TReNDS把根因分析从半小时缩到1分钟,用的是Bedrock智能体流水线,运维团队可参考。原文稍后读已读值得跟进有用关注 Amazon Bedrock
12:51官方账号arXiv cs.AI@Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang, Raj Agrawal, Anish Agarwal, Raaz DwivediORCA-bench用一套运行六天的OpenTelemetry微服务系统,通过Prometheus、Jaeger和OpenSearch/Grafana接口暴露指标、日志和链路,共构造1079个值班根因分析任务。五个前沿智能体在Medium难度任务上最佳RCA准确率仅25.3%,Hard难度为10.0%。最弱模型在40%的故障报告中给出不合理根因;去掉源代码访问后所有指标下降。专家SRE对真值症状做了复核,LLM评判与人类评分加权kappa为0.90。论文ORCA-bench根因分析智能体推荐理由:想看看编程Agent在真实值班场景有多靠谱?ORCA-bench给了1079个线上故障任务,最强模型也只答对四分之一。原文稍后读已读值得跟进有用关注 ORCA-bench
11:31官方账号arXiv cs.LG@Md. Kamrul Hossain, Walid Aljoby这篇论文提出MILD框架,用于自驱动网络中对三个宏意图(连续遥测、实时分析、程序化执行)进行主动故障预测和根因消歧。MILD采用教师增强的混合专家架构,联合优化意图故障预测和根因归因。通过SHAP可解释性实现KPI级诊断,并通过多时间跨度建模进行动态故障紧急度估计。在三个不同真实度的环境(统计基准、微服务应用、SDN边缘云测试床)中评估,MILD实现了高故障检测率、强修复提前时间和准确的意图级根因消歧。论文MILD自驱动网络意图驱动推荐理由:想搞自治网络的必看,MILD能提前预测故障还能准确定位根因,比传统的阈值检测反应快多了。原文稍后读已读值得跟进有用关注 MILD
11:34官方账号arXiv cs.AI@Aoyang Fang, Yifan Yang, Jin'ao Shang, Qisheng Lu, Junjielung Xu, Rui Wang, Songhan Zhang, Yuzhong Zhang, Boxi Yu, Pinjia HeOpenRCA 2.0 引入了 PAVE 协议,通过故障注入重建因果传播路径,标注了 500 个跨系统实例的步骤级因果链。在 11 个前沿 LLM 上测试,完全恢复根因集的成功率平均仅 20.7%。放宽条件后发现,模型在 76.0% 的案例中能识别至少一个正确根因服务,但只有 61.5% 能将服务与观察到的症状通过验证的因果路径关联起来。该基准揭露了仅靠结果标签评估时隐藏的未接地诊断失败模式。论文OpenRCA 2.0PAVELLM推荐理由:这篇论文搞了个新基准 OpenRCA 2.0,用 PAVE 协议给每一步因果关系打标签,发现 LLM 猜对根因容易,但连对因果路径很难——这比只看结果靠谱多了。原文稍后读已读值得跟进有用关注 OpenRCA 2.0
10:36官方账号arXiv cs.AI@Anastasiia Kuvshinova, Seungmin Jin精选本文提出Graph Traversal Agent,一种结合LLM推理与确定性图操作的根因分析代理,用于诊断Kubernetes事件。该方法通过类型化证据图、LangGraph状态机和独立验证阶段,确保分析结果可审计且不依赖场景捷径。在ITBench基准测试中,系统在23个场景子集上根因实体F1从0.6087提升至0.9130,但消融实验显示部分提升源于提示词优化,去除提示后F1降至0.6958。研究强调,真正的泛化能力需通过提示消融、级联源检查等轻量级验证来区分。目前工作限于ITBench OpenTelemetry-demo快照,未声称生产就绪。论文Kubernetes根因分析LLM代理推荐理由:Kubernetes运维团队终于有了一个可审计的根因分析方案——Graph Traversal Agent通过图约束和独立验证,避免了LLM常见的幻觉和场景作弊。做K8s可观测性或事件诊断的开发者,值得看看这个结合图遍历与LLM的框架设计。原文稍后读已读值得跟进有用关注 Kubernetes