10:34官方一手arXiv: Anthropic@Jonghyun Jee, Aaron Shaw一项研究分析了八种来自Anthropic、OpenAI、阿里和Mistral四家公司的模型在电影评价中的取向。研究者使用200部电影基准,将其划分为影评口碑、商业成功和双重认可三类,对每个模型进行20,000次两两强制选择。基于Bradley-Terry估计发现,所有模型都更偏好影评口碑好但商业上不知名的电影,而非商业成功但影评认可低的电影,且该取向随模型规模增大而增强。嵌套OLS回归显示,评价取向、公开可见度和大众接受度分别影响偏好;调整公开可见度后,模型对双重认可电影的偏好发生逆转。评价型与推荐型提示词会引发不同排序,显示该取向可能在真实部署中间接显现。论文AnthropicOpenAIAlibaba10 个信源在谈事件专题推荐理由:各家大模型选电影时都更认影评口碑,不认票房。测试了20万次对比,模型越大越看重口碑,挺有意思的。原文稍后读已读值得跟进有用关注 Anthropic