事件专题 · 官方一手

OptimismBench:语言模型概率判断的乐观偏差与对齐效应

为了检测语言模型在概率判断中的方向性偏差,研究者提出OptimismBench,使用反向配对法计算符号偏差分数。对8个提供商的16个模型测试发现,14个模型呈现乐观偏差,仅Anthropic的旗舰层表现悲观。11组基座模型与聊天模型对比显示,后训练方向在不同模型家族中产生相反偏差。在17个模型、6种语言的比较中,模型身份主导语言因素,模型间方差是语言间方差的4.7倍。研究者发布了3870个条目、覆盖10种语言的偏差审计数据集。

当前结论

这篇论文发现大多数大模型判断概率时普遍乐观,只有Anthropic的模型偏悲观,还揭示对齐训练会改变偏差方向,值得AI开发者和伦理研究者关注。

4 个信源67° AI 热度最后更新 2026/7/29 14:38:55

证据链

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情