09:08官方账号arXiv cs.AI@Yujia Liu, Jiayan Lin, Zijin Hong, Zheng Yuan, Shengyuan Chen, Hao Chen, Qinggang Zhang, Xiao Huang, Feiran Huang精选73°研究团队推出TIDE-Bench基准,评估大语言模型在链式模糊和意图漂移场景下的对话式Text-to-SQL能力。该基准基于BIRD数据集的514个锚定SQL构建,包含1,542个样本。评估了12个先进LLM,发现链式识别瓶颈不受澄清频率影响,意图漂移识别-解决存在显著差距,且两种失败模式同时激活时会相互重叠。论文TIDE-BenchText-to-SQLLLM推荐理由:研究人员发布了TIDE-Bench基准,专门测试LLM在复杂对话SQL中的意图理解能力,发现现有模型在链式识别和意图漂移处理上仍有明显不足。原文稍后读已读值得跟进有用关注 TIDE-Bench