论文12:08DataGovBench:评估大模型在真实数据场景中表现的新基准研究团队用政府开放数据搞了个新测评,发现现在的大模型遇到多表格和外部知识就掉链子,专治各种表面功夫,推荐给关心模型真实落地能力的朋友。#DataGovBench#LLM#数据分析#基准aarXiv cs.AI@So Hasegawa 等 4 人原文稍后读已读值得跟进有用关注 DataGovBench