模型00:57PlanBench-XL:在大型工具生态中评估LLM智能体的长程规划想看看你用的LLM在多工具长流程场景下到底多靠谱?PlanBench-XL用上千个工具设计了真实任务链,测出来主流模型成功率不到40%,值得一测。#PlanBench-XL#LLM#智能体#工具使用AK@_akhaliq原文稍后读已读值得跟进有用关注 PlanBench-XL