10:15官方账号arXiv cs.AI@Dennis Gross, Helge Spieker精选73°研究人员提出使用概率模型检查作为测试预言机,对大型语言模型生成的后验解释进行系统性测试。该方法在七个MDP环境中测试了三个开源LLM,一个推理模型通过85%的测试用例,中等规模模型通过70%,而10亿参数模型的表现低于随机基线。测试通过查询分类法结构化输入空间,并根据问题特定的诊断难度分数对测试用例进行优先级排序。论文LLM后验解释器模型检查推荐理由:这篇论文教你如何用模型检查方法自动验证LLM生成的解释是否可靠,比随机测试发现更多问题。原文稍后读已读值得跟进有用关注 LLM