12:49官方账号arXiv cs.AI@Zeshen Zheng, Yujia He, Qianmian Lin, Xiangyue Huang, Wenqing Chen这篇论文关注开放生成任务中的公平性评估,指出当模型生成“美国CEO”时,缺乏明确的人口统计目标分布。作者将目标构建拆解为评估对象、先验可采纳性、分配和操作化四个承诺,并在地理成员解释下允许地理先验。在AP-Bench基准上,地理派生目标与生成结果存在0.508至0.606的分布差异;改用等类别对照后,模型特定的JSD2变化范围达0.279至0.355。论文表明目标构建本身是公平性评估的组成部分,而非评估前的附属步骤。论文AP-Bench公平性生成模型推荐理由:如果你是搞生成模型评测的,这篇论文指出了公平性评估里常被忽略的问题:该拿什么目标分布去比。它给了个框架,还附了AP-Bench的具体数值。原文稍后读已读值得跟进有用关注 AP-Bench