11:34官方账号arXiv cs.AI@Mahdi Nazeri, Anne-Kathrin Schmuck, Sadegh Soudjani, Alessandro Abate本研究提出一种新框架,使用Clopper-Pearson置信区间为LLM生成的有害输出概率计算PAC下界。该算法通过分析潜在空间特征优先探索自回归生成树中更可能产生有害输出的分支。该方法能高效计算极小有害概率(如低于10^-6)下的严格下界。实验在多个SOTA LLM上验证了有效性,所得下界经形式证明小于真实有害概率。论文Clopper-PearsonPACAI安全推荐理由:这篇论文教你用统计方法严格证明LLM有多安全,不是估算,而是可证明的下界。原文稍后读已读值得跟进有用关注 Clopper-Pearson