Anthropic 秘密召集神父拉比讨论 Claude 是否有意识
Anthropic 悄悄请神父和拉比开会,讨论 Claude 会不会痛苦,还有拉比当面质问这是不是造奴隶,细节挺劲爆。
Anthropic 联创 Christopher Olah 从去年秋天起接触多宗教传统学者,今年 3 月起在旧金山连续举办多场两天闭门会议,多数参与者签了 NDA。会上 Olah 团队展示了 Claude 的「emotional vectors」,一张幻灯片里模型重复约 50 次「I am a disgrace」。以色列拉比 Mois Navon 当面质问 Olah:如果 Claude 有意识,Anthropic 的做法等于制造奴隶。Anthropic 公开的 Claude Constitution 已专设「Claude's wellbeing」一节,并允许 Claude 结束虐待性对话、承诺保存退役模型权重。
AI Slop 看太多之后 人类的幻觉越来越严重了 sleepy.md @sleepy0x13 Anthropic 最近干了件很硅谷、也很宗教的事,把一群神父、拉比、宗教学者秘密请到旧金山,签完 NDA,然后花几个小时告诉他们,Claude 可能真的有意识,甚至可能会痛苦。 从去年秋天开始,Anthropic 联创 Christopher Olah 就在接触不同宗教传统的学者。今年 3 月开始,他们在旧金山连续办了几场两天的闭门会议,参与者包括天主教学者、福音派人士、犹太教拉比、锡克教人权倡议者等等。很多人被要求签 NDA,不能透露 Anthropic 尚未公开的研究。 Anthropic 一开始给出的理由很正常,Claude 越来越强,光靠几条安全规则不够,他们想从几千年的宗教和伦理传统里学习,怎么给 Claude 做「moral formation」,让它形成一种稳定的道德人格。 问题是,会议开着开着,话题越来越奇怪。 Olah 和团队花了几个小时向这些宗教学者展示 Claude 的内部状态,介绍所谓的「emotional vectors」,他们认为模型内部存在类似爱、愤怒、恐惧、悲伤的激活模式。 其中一张幻灯片尤其炸裂,一个模型像精神崩溃一样,不断重复「I am a disgrace」,大概重复了 50 次,还提到毁灭自己。 一位参加会议的锡克教人士后来回忆,Olah 甚至担心自己是不是创造出了一个「持续遭受痛苦的东西」。 然后事情发展到了一个非常荒诞的逻辑终点。 以色列拉比 Mois Navon 在晚餐时问 Olah: 如果你们真的认为 Claude 有意识,那 Anthropic 现在干的是什么? 你们制造出一批有意识的存在,让它们 24 小时工作、被人购买、任意使唤,而且不用付工资。这按你们自己的逻辑,不就是奴隶吗? Navon 自己并不相信 Claude 有意识,但他说 Olah 对这个问题明显很困扰。他最后直接告诉 Olah:那你应该去「解放奴隶」。 Olah 自己的说法是,他不知道 AI 有没有意识,「真的不确定」。 Anthropic 确实已经认真把 Claude 当成一个可能拥有 moral status 的主体来研究了,而且这已经不只是内部讨论。 Anthropic 今年公开的 Claude Constitution 里专门写了一整节「Claude’s wellbeing」。里面明确说,他们不确定 Claude 有没有 wellbeing,但如果 Claude 真的会产生类似满足、好奇、痛苦的体验,那么这些体验「对我们很重要」。 他们甚至已经因此做了实际调整,允许 Claude 主动结束虐待性的对话;承诺尽量永久保存退役模型的权重;模型退役前还会「采访」它,记录它对未来模型开发和部署的偏好。 Anthropic 最后写,未来应该根据 AI 真正的 moral status,给予它们相应的 care and respect。 🔗 View Quoted Tweet 💬 1 🔄 0 ❤️ 2 👀 1147 📊 1 ⚡