ITBench-AA：前沿模型在企业IT任务基准测试中得分不足50%

精选理由

企业IT团队终于有了衡量AI智能体真实能力的标尺——前沿模型都不到50分，说明自动化运维还有很大提升空间，做IT运维或AI落地的建议点开看看差距在哪。

AI 摘要

IBM与Artificial Analysis联合推出ITBench-AA，这是首个针对企业IT运维场景的智能体基准测试。测试涵盖事件响应、故障排查等真实任务，结果显示包括GPT-4、Claude在内的前沿模型平均得分低于50%。该基准揭示了当前AI智能体在处理复杂企业IT流程时的能力短板，为行业提供了可量化的评估标准。

ITBench-AA：前沿模型在企业IT任务基准测试中得分不足50% — 图片来源 · Hugging Face: Blog

AI 翻译 · 中文

阅读原文