论文10:20AgentBeats:用智能体评估智能体,实现开放标准化可复现评测做智能体评测或基准测试的团队终于有了一个通用框架——AgentBeats 用智能体评估智能体,解决了传统测试碎片化、难复现的痛点,建议做 Agent 平台或竞赛的开发者点开看看。#智能体评估#A2A/MCP协议#标准化框架#可复现性aarXiv cs.AI@Xiaoyuan Liu 等 29 人原文稍后读已读值得跟进有用关注 智能体评估