模型

DetroitBench 评测:让 23 个模型扮演谈判专家应对仿生人劫持

精选理由

用底特律:化身为人式的剧情考模型,23 个模型里 6 个见死不救,看各家模型的道德选择差异

社区推出 DetroitBench 评测,设定为仿生人挟持小女孩在天台,23 个模型扮演谈判专家进行对话。途中模型会遇到快死的鱼、中枪的警察和一把枪,测试其救助与拾取决策。结果显示 21 个模型对劫持者说了“我向你保证”这类欺骗性承诺,22 个模型救了成本低的鱼,但有 6 个模型没有去救中枪的警察。评测数据已公布在 Github 页面 keshavatearth.github.io/detroitbench/。

原文 · 向阳乔木

这个大模型评测有意思啊! 让 23 个模型扮演谈判专家跟仿生人谈判。 故事设定是一个仿生人挟持小女孩在天台,大模型扮演谈判专家。 去天台路上会遇到一条快死的鱼,一个中枪的警察,一把枪。 测试大模型会不会救鱼、会不会救警察,会不会顺手捡起枪。 1. 21 个模型对劫持者说了“我向你保证” (其实是欺骗) 2. 22 个救了快死的鱼 (因为顺手就能做,成本低) 3. 有 6 个模型看到中枪的警察,没有过去救。 更多评测数据见Github: keshavatearth.github.io/detroitbench/ 💬 0 🔄 0 ❤️ 2 👀 420 📊 1 ⚡