8月8日
7月31日
12:51
12:51官方账号arXiv cs.AI@Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang, Raj Agrawal, Anish Agarwal, Raaz Dwivedi
ORCA-bench用一套运行六天的OpenTelemetry微服务系统,通过Prometheus、Jaeger和OpenSearch/Grafana接口暴露指标、日志和链路,共构造1079个值班根因分析任务。五个前沿智能体在Medium难度任务上最佳RCA准确率仅25.3%,Hard难度为10.0%。最弱模型在40%的故障报告中给出不合理根因;去掉源代码访问后所有指标下降。专家SRE对真值症状做了复核,LLM评判与人类评分加权kappa为0.90。
推荐理由:想看看编程Agent在真实值班场景有多靠谱?ORCA-bench给了1079个线上故障任务,最强模型也只答对四分之一。
6月26日
11:34
11:34官方账号arXiv cs.AI@Aoyang Fang, Yifan Yang, Jin'ao Shang, Qisheng Lu, Junjielung Xu, Rui Wang, Songhan Zhang, Yuzhong Zhang, Boxi Yu, Pinjia He
OpenRCA 2.0 引入了 PAVE 协议,通过故障注入重建因果传播路径,标注了 500 个跨系统实例的步骤级因果链。在 11 个前沿 LLM 上测试,完全恢复根因集的成功率平均仅 20.7%。放宽条件后发现,模型在 76.0% 的案例中能识别至少一个正确根因服务,但只有 61.5% 能将服务与观察到的症状通过验证的因果路径关联起来。该基准揭露了仅靠结果标签评估时隐藏的未接地诊断失败模式。
推荐理由:这篇论文搞了个新基准 OpenRCA 2.0,用 PAVE 协议给每一步因果关系打标签,发现 LLM 猜对根因容易,但连对因果路径很难——这比只看结果靠谱多了。