09:33官方一手arXiv: Anthropic@Seonglae Cho, Adriano Koshiyama精选为了检测语言模型在概率判断中的方向性偏差,研究者提出OptimismBench,使用反向配对法计算符号偏差分数。对8个提供商的16个模型测试发现,14个模型呈现乐观偏差,仅Anthropic的旗舰层表现悲观。11组基座模型与聊天模型对比显示,后训练方向在不同模型家族中产生相反偏差。在17个模型、6种语言的比较中,模型身份主导语言因素,模型间方差是语言间方差的4.7倍。研究者发布了3870个条目、覆盖10种语言的偏差审计数据集。论文OptimismBenchAnthropic语言模型3 个信源在谈事件专题推荐理由:这篇论文发现大多数大模型判断概率时普遍乐观,只有Anthropic的模型偏悲观,还揭示对齐训练会改变偏差方向,值得AI开发者和伦理研究者关注。原文稍后读已读值得跟进有用关注 OptimismBench