8月10日
10:27
10:27官方账号arXiv cs.AI@Rodrigo Ferreira Rodrigues, Karim Radouane, Jose G Moreno, Lynda Tamine
GeoBenchLLM是一个评估大语言模型地理相关任务能力的基准,整合了12个公开数据集。该基准覆盖地理空间和时间理解两类任务,测试了多个主流LLM。结果显示,推理能力和模型尺寸对整体性能影响显著。基准代码已在GitHub公开。
推荐理由:想测LLM的地理常识?这个新基准GeoBenchLLM用12个数据集考了主流模型,结论是模型越大、推理越强,GitHub上可跑。