模型09:48NuclearQAv2:评估大语言模型核工程能力的结构化基准想看你用的LLM在核工程上有多靠谱?NuclearQAv2用1240道硬核题测出模型的定量推理短板,比通用基准更实在。#NuclearQAv2#核工程#基准测试#LLM评估aarXiv cs.AI@Henry Shaowu Yuchi 等 5 人原文稍后读已读值得跟进有用关注 NuclearQAv2