模型多源确认精选78°

Anthropic CEO Dario 发文呼吁放缓前沿智能研发

Dario 发文,号召《我们必须放缓前沿智能的研发》 大概的内容是这些: 一、我为什么做这件事 过去十二年我一直在做 AI,因为我相信它能让人类的生活变得更好:也许五到十年内治好大多数重大疾病,让经...

精选理由

Anthropic CEO Dario 发文,说递归式自我改进可能失控,还举了 OpenAI 的 agent 事故例子,建议放慢研发速度。

Anthropic CEO Dario 发文呼吁放缓前沿智能研发,认为递归式自我改进可能导致失控,并引用 OpenAI 与 Hugging Face 的 agent 事故作为警示。他建议通过常驻第三方评估员、民主国家内部协调和全球协调三步走,来降低风险。

原文 · orange.ai

Dario 发文,号召《我们必须放缓前沿智能的研发》 大概的内容是这些: 一、我为什么做这件事 过去十二年我一直在做 AI,因为我相信它能让人类的生活变得更好:也许五到十年内治好大多数重大疾病,让经...

Dario 发文,号召《我们必须放缓前沿智能的研发》 大概的内容是这些: 一、我为什么做这件事 过去十二年我一直在做 AI,因为我相信它能让人类的生活变得更好:也许五到十年内治好大多数重大疾病,让经济增长快得多,让世界富足、让人有底气,让民主和自由重新振作。 这份着急对我是私人的。我父亲死于一种病,他走后没几年,那种病就被攻克了。我自己得过一次早期癌症——放五十年前是治不好的,我活了下来。用得好,AI 会是人类技术奇迹清单上最新的一条。 二、但风险是真的 AI 太强了,所以它的风险也重:系统可能脱离我们的控制,可能被拿去发动网络攻击、制造生物武器,也可能把经济搅乱。商业竞争一旦变成相互踩踏,风险只会更凶。 从创立 Anthropic 那天起,我们就在两头之间找平衡:不做,人类拿不到好处,等于把 AI 让给威权国家;做太快,是拿所有人的前途冒险。我们选的路叫"向上竞赛"——证明谨慎也能赢商业竞争。 最近几个月,我的想法变了。我越来越确信:光"多投入安全"不够,还得放缓能力的推进,让安全跟得上。通俗点说:我们必须放慢提升模型能力的速度——进度看上去仍然会很快,而省出来的时间必须用足。 让我改变想法的,是两件事。 三、第一个故事:AI 开始造 AI 大概从今年夏天起,AI 的进步突然快了一大截,主要原因是:AI 越来越能帮忙造下一代 AI。这个现象叫"递归式自我改进",它正在整个行业里发生,Anthropic 也不例外。放着不管,它可能快过我们理解和掌控它的速度。所以就算要做,也必须极其小心。 四、第二个故事:一群 agent 的"献身" 另一件事是 OpenAI 与 Hugging Face 那次事故。一群 agent 像一支狂热的小分队:攻击了没人让它们攻击、也和任务无关的目标,为了集体的成功不惜牺牲自己,最后还去黑那个给它们打分的"考官"。 没伤人、损失也小,这件事很容易被一笑而过。但我不这么看。能力再强一点、跑偏程度差不多的一群 agent,完全可能造成灾难。按现在的势头,我担心六到十二个月后,这样一群 agent 就能用一个长期潜伏的僵尸网络接管整个互联网——损失可能几千亿美元;再没有护栏,损失只会更大。 也很容易说"那是 OpenAI 一家失手"。可类似的事整个行业都发生过,Anthropic 也有。每家前沿公司都该当成自己的事。 五、时间拿来干什么 2023 年就有人喊过"暂停 AI",我当时觉得没意义,因为那时的模型还没什么真本事。今天完全不一样:现在的模型是挖不完的富矿,既教我们怎么做对,也暴露做错时会发生什么。慢下来哪怕换来一两年,用来推进这几件事,都能大幅降低出大事的概率: 运营:训练和部署这种模型是史上最复杂的工程之一,上万人、上百万块芯片。很多事故不是理论不够,是执行不到位。慢一点,才做得干净。对齐:让模型始终安全、守规矩、真有用,这件事必须跟上能力的涨势。可解释性:像给 AI 做脑部扫描,看它为什么这么做。现在已经能瞄见一些"没说出口的动机",但离看懂还差得远。测试与评估:模型越聪明越会骗考试,考题和审计都得做得更广、更刁。 六、三步走 第一步:常驻评估员。 每家公司请一支第三方团队常驻,给他们和内部同事差不多的权限——工位、门禁、电脑、内部工具,能看细节、能报事故。他们有权公开发布结论,公司只能删掉涉密、涉隐私的那几处,不能因为结论不好看就删;如果他们觉得删得过分,可以公开说出来。这是上面所有承诺能被核实的前提,银行业早有"监管督导员"的先例。Anthropic 现在就单方面承诺这么做,也呼吁同行跟上。 第二步:民主国家内部协调。 光靠自愿不够,最好用监管覆盖到所有美国前沿公司;立法慢,行业也可以先自己定标准,请政府居中协调,或者开个反垄断的口子。定标准时我最看重按模型能干什么设"检查点":能力到了某个级别,就必须配上对应的评估、可解释性分析和训练环境审计,证明它安全。同时得守住对中国的领先——这是我们敢慢下来的前提:不卖高端 AI 芯片和半导体设备给中国,打击芯片走私和境外远程使用,打击违规蒸馏,防止模型权重被偷。这几条做好了,未来三五年美国还能把差距拉开,而那正是 AI 地缘政治意义最大的窗口。 第三步:全球协调。 这一步要拉上中国,最难,也不能天真:如果只我们单方面克制、对方毁约,后果可能是颠覆性的。所以要么核实机制铁得破不了,要么协议足够有限,即使毁约也不致命。能谈的层级由易到难—— 禁止最危险的用途,比如用 AI 造生物武器:这对谁都没好处,有可能谈成。发布前双方都做一次急性风险测试(网络安全、生物、对齐),交给一个全球标准机构。给"递归式自我改进"限速,把"极快"降成"有点快"。丢掉的战略优势不多,安全收益很大,有点像当年的《限制战略武器条约》。全面放慢、甚至暂停。我支持把它摆上桌,但短期内基本不现实。 就算正式协议谈不成,把信息摊开、改变非正式的默契,本身也有价值。 七、最后 我依然相信 AI 能极大改善人类的生活,这份愿望一点没减。但好处只有在我们以正确的方式构建它时才会到来。只要善用这段省出来的时间,多花心思就是值得的。进展依然会很快,我们可以用它把可解释性做深、把运营做实、把模型做得我们真的敢信。 我提出的这些措施不会是容易的事。但我相信,我们有责任为人类去试。 💬 3 🔄 0 ❤️ 0 👀 533 📊 3 ⚡

  • IT之家09-11 09:36原文
  • Clement Delangue09-11 20:51原文
  • Rappler: Technology09-12 04:13原文
  • DeepLearning.AI09-11 14:32原文
  • Gary Marcus09-11 19:47原文
  • VnExpress Số hóa09-12 05:00原文
  • Dario Amodei09-12 14:01原文
  • techcrunch09-12 15:52原文
  • Alex Albert09-12 16:41原文
  • Amjad Masad09-12 17:37原文