人类创造力基准(HCB): 专业分歧即品味差异

The Human Creativity Benchmark

精选理由

这篇论文用15000个专家评价告诉你, 测AI创意能力不能只看平均分, 分歧本身才是宝藏。

AI 摘要

该论文提出人类创造力基准(HCB), 收集15000个专业判断覆盖5个创意领域和3个工作流阶段(构思/模型/细化)。HCB将评价分为收敛(如技术正确性)和发散(如美学方向), 发现专业分歧代表真实品味差异而非测量误差。单一质量指标会丢失关键信息: 模型在哪些维度必须正确、哪些维度应保持可操控性。

AI 翻译 · 中文

该论文提出人类创造力基准(HCB), 收集15000个专业判断覆盖5个创意领域和3个工作流阶段(构思/模型/细化)。HCB将评价分为收敛(如技术正确性)和发散(如美学方向), 发现专业分歧代表真实品味差异而非测量误差。单一质量指标会丢失关键信息: 模型在哪些维度必须正确、哪些维度应保持可操控性。

arXiv cs.AIModern AI evaluation frameworks treat evaluator disagreement as noise to be resolved. In creative domains, professional disagreement reflects genuine differences in taste, not measurement error. We argue that evaluating