事件专题 ·官方一手

AgentHop 基准发布:1,011 道题拆解智能体失败原因

论文推出诊断型基准 AgentHop,包含 1,011 道多选题和七工具沙盒,在固定 token、轮次、工具调用约束下测试。它把单一准确率拆成检索、综合、工具调用、资源管理四个维度,覆盖 19 个模型。结果显示行为按模型家族聚集:GPT 提前行动,Anthropic 和 GLM 先验证再行动,DeepSeek 和 Kimi 过度搜索,Gemini-3 Pro 较均衡。同家族内部也有分化,Claude Opus 4.6 检索更多,Sonnet 4.6 综合更好。

当前结论

一个把智能体准确率拆开看的新基准,能看出各家模型是乱搜还是不敢搜,做 agent 评估的可以拿去用。

11 个信源44° AI 热度最后更新 2026/9/28 06:45:01

证据链

11 个信源
相关来源 2歸藏(guizang.ai)
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。