09:53官方账号arXiv cs.AI@Isaiah Andrews这篇论文把决策论中的表示定理用于AI评估:检查模型行为是否满足公理,不需要外部标签或人类反馈。作者用德菲内蒂定理做概率一致性检验、用阿夫里亚特定理检验偏好理性、用Echenique和Saito(2015)定理检验主观期望效用。每个检验都给出连续惩罚项,当行为可被理性化时惩罚为零。由于公理是充要条件,通过检验的模型在理性标准下无法被同一数据上的其他测试拒绝。这些惩罚不限制具体目标函数,因此可与其他评估和训练信号互补。论文LLM无标签评估表示定理推荐理由:想不靠人工标注就给模型打分?这篇论文用数学定理把理性检验变成可计算惩罚,还给了三个现成公式。原文稍后读已读值得跟进有用关注 LLM