AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

PAC

共 1 条相关 AI 资讯
7月23日
11:34
11:34官方账号arXiv cs.AI@Mahdi Nazeri, Anne-Kathrin Schmuck, Sadegh Soudjani, Alessandro Abate
本研究提出一种新框架,使用Clopper-Pearson置信区间为LLM生成的有害输出概率计算PAC下界。该算法通过分析潜在空间特征优先探索自回归生成树中更可能产生有害输出的分支。该方法能高效计算极小有害概率(如低于10^-6)下的严格下界。实验在多个SOTA LLM上验证了有效性,所得下界经形式证明小于真实有害概率。
论文Clopper-PearsonPACAI安全

推荐理由:这篇论文教你用统计方法严格证明LLM有多安全,不是估算,而是可证明的下界。
原文
精选全部日报登录