论文12:51ORCA-bench:从值班任务看语言模型Agent的根因分析能力想看看编程Agent在真实值班场景有多靠谱?ORCA-bench给了1079个线上故障任务,最强模型也只答对四分之一。#ORCA-bench#根因分析#智能体#可观测性aarXiv cs.AI@Albert Gong 等 8 人原文稍后读已读值得跟进有用关注 ORCA-bench