11:43官方账号arXiv cs.AI@Samuel Xiao, Judy Song, Rory Hu, Ziliang Zong73°研究人员推出NL2AGBench基准,评估大模型将英语几何问题转换为AlphaGeometry兼容形式表示的能力。该基准使用AlphaGeometry中的执行验证而非仅依赖文本相似性来评估翻译质量。实验显示闭源模型可执行翻译率超80%,而最大开源模型难以保持几何约束并产生有效形式化。研究团队引入错误分类法,研究少样本提示、微调和人工引导提示等缓解策略。论文NL2AGBenchAlphaGeometry大模型推荐理由:Google推出NL2AGBench基准,测试大模型将几何问题转为AlphaGeometry形式语言的能力,闭源模型表现远超开源模型。原文稍后读已读值得跟进有用关注 NL2AGBench