论文Agent 与开发者11:07Argo-Bench评估数据代理企业级工作流Argo-Bench用真实规模数据测试AI代理,发现顶级模型完成率不足35%,暴露了当前AI在企业数据环境中的局限性。#Argo-Bench#数据代理#企业级工作流#评估框架aarXiv cs.AI@Gabriel Tomitsuka 等 5 人原文稍后读已读值得跟进有用关注 Argo-Bench